Qu'est-ce que la quantification ? Réduire les modèles d'IA pour les exécuter sur votre propre machine
Faire tourner un énorme modèle 70B sur un seul PC de gaming au lieu d'un rack de GPU de data center est rendu possible par la quantification, qui abaisse la précision numérique des poids d'un modèle pour réduire drastiquement sa taille et sa mémoire. Alors que la distillation transfère le savoir vers un modèle distinct plus petit, la quantification allège le même modèle. Cet article l'explique avec une analogie de compression de photo. La quantification remplace les poids stockés en décimaux FP16/FP32 par des entiers INT8 (8 bits) ou INT4 (4 bits), réduisant les octets par poids (FP32=4, INT8=1, INT4=0,5) ; comme compresser une photo RAW en JPEG, on sacrifie un peu de précision pour un gros gain, et la surprise est le peu qu'on y perd. Côté mémoire, le 4-bit utilise environ un quart du FP16 : un modèle 70B passe de ~140GB à ~35GB, et un 8B en 4-bit fait ~4.5-5GB, tenant dans un GPU de milieu de gamme à 8GB de VRAM pour un usage local (la démocratisation des LLM). Côté précision, INT8 est quasiment sans perte et INT4 se dégrade sous 4% sur les tâches générales, mais la perte est plus marquée pour les maths, le code et le raisonnement difficile (cela se voit par une légère hausse de la perplexité), donc choisissez le nombre de bits selon la tâche. Principales méthodes : GPTQ (pionnier du 4-bit précis), AWQ (protège le ~1% de poids les plus importants, souvent 1-2% plus précis et plus rapide), GGUF (format llama.cpp/Ollama, Q2_K-Q8_0, hybride CPU+GPU, pour le local) et QLoRA (base 4-bit plus LoRA pour le fine-tuning sur GPU grand public). Cela diffère de la distillation et du fine-tuning, et les trois se combinent généralement. Pour démarrer, exécutez un modèle GGUF avec Ollama en une commande, choisissez Q4/Q8 selon la VRAM et évitez l'INT4 pour le code ou les maths exactes. La plupart des grands modèles sont livrés déjà quantifiés, il suffit de les télécharger. Garder l'intelligence, ne perdre que le poids.