量子化(quantization)とは?AIモデルを軽くして手元で動かす仕組み
70B(700億パラメータ)の巨大モデルが手元のゲーミングPC1台で動く、それを可能にするのが量子化(quantization)。モデルの重みの数値精度を下げてサイズと必要メモリを劇的に小さくする技術で、モデル蒸留が別の小さいモデルに知識を移すのに対し量子化は同じモデルを軽くする。本記事は仕組みを写真の圧縮のたとえで解説する。量子化は重み(パラメータ)をFP16/FP32の小数からINT8(8ビット)やINT4(4ビット)の整数に置き換え、1重みあたりの容量を減らす(FP32=4バイト、INT8=1バイト、INT4=0.5バイト)。RAW写真をJPEGに圧縮するように少しの精度を犠牲に大きな軽さを得て、驚くのは失うものがこれほど少ないこと。どれだけ軽くなるかは、4ビット化でFP16比約1/4、70Bモデルは140GB→約35GB、8Bモデルは4ビットで約4.5〜5GBとミドルクラスGPU(VRAM 8GB)に収まりローカル実行できる=LLMの民主化。精度はINT8でほぼ無損失、INT4でも一般的なQ&Aや常識タスクなら劣化4%未満との報告だが、数学・コード生成・難しい推論では低下が目立ちやすく用途に合うビット数を選ぶのが肝心(パープレキシティの微増として現れる)。主な手法はGPTQ(精度を保つ4ビット圧縮の先駆け)、AWQ(重要な約1%の重みを保護しGPTQより1〜2%高精度+高速)、GGUF(llama.cpp/Ollama形式でQ2_K〜Q8_0、CPU+GPU併用可、ローカル向け)、QLoRA(4ビット土台にLoRAで家庭用GPUでも微調整)。蒸留(別の小モデルに移す)・ファインチューニング(特定用途に追加学習)とは狙いが違い、組み合わせて使うのが普通(蒸留した小モデルをさらに量子化、量子化土台にFT等)。始め方はローカルならGGUF(Ollama)を1コマンド、VRAMに合わせてQ4/Q8を選び、コード生成や厳密計算ならINT4を避けINT8以上に。たいてい量子化済みモデルが配布されダウンロードして使うだけ。賢さはそのまま重さだけ落とす最も実用的な一手。数値は各種公表資料の引用で傾向の参考。