ローカルllm 量子化

ローカルLLM

ローカルLLMの量子化(GGUF/GPTQ/AWQ)を理解する完全ガイド

ローカル環境でLLMを動かすとき、一番気になるのがGPUメモリ(VRAM)の消費量です。最新の7Bモデルでも量子化なし(FP16)では16GB以上のVRAMが必要で、RTX 3060やRTX 4060では到底動きません。しかし量子化(Qua…