¿Qué es la cuantización? Encoger modelos de IA para ejecutarlos en tu propia máquina
Que un enorme modelo de 70B corra en un solo PC gaming en casa, en lugar de un rack de GPU de centro de datos, es posible gracias a la cuantización, que reduce la precisión numérica de los pesos de un modelo para encoger drásticamente su tamaño y memoria. Mientras la destilación traslada el conocimiento a otro modelo más pequeño, la cuantización hace más ligero el mismo modelo. Este artículo lo explica con una analogía de compresión de fotos. La cuantización reemplaza los pesos almacenados como decimales FP16/FP32 por enteros INT8 (8 bits) o INT4 (4 bits), recortando los bytes por peso (FP32=4, INT8=1, INT4=0,5); como comprimir una foto RAW a JPEG, sacrificas un poco de precisión a cambio de una gran reducción, y lo sorprendente es lo poco que renuncias. En memoria, 4-bit usa alrededor de un cuarto de FP16: un modelo de 70B baja de ~140GB a ~35GB, y uno de 8B a 4-bit ocupa ~4.5-5GB, que cabe en una GPU de gama media de 8GB de VRAM para uso local (la democratización de los LLM). En precisión, INT8 es casi sin pérdidas e INT4 se degrada por debajo del 4% en tareas generales de preguntas y respuestas o de sentido común, pero la pérdida es más notable en matemáticas, generación de código y razonamiento difícil (se manifiesta como un pequeño aumento de la perplejidad), así que elige el número de bits según la tarea. Métodos principales: GPTQ (pionero del 4-bit preciso), AWQ (protege el ~1% de los pesos más importantes, a menudo 1-2% más preciso y rápido), GGUF (formato llama.cpp/Ollama, Q2_K-Q8_0, híbrido CPU+GPU, para local) y QLoRA (base de 4-bit más LoRA para fine-tuning en GPU de consumo). Se diferencia de la destilación (trasladar a otro modelo pequeño) y del fine-tuning (añadir conocimiento de tarea), y las tres suelen combinarse (cuantizar un modelo destilado; hacer fine-tuning sobre una base cuantizada). Para empezar, ejecuta un modelo GGUF con Ollama en un comando, elige Q4/Q8 según la VRAM y evita INT4 para código o matemáticas exactas. La mayoría de los modelos principales ya vienen cuantizados, así que solo los descargas y usas. Conserva la inteligencia, suelta solo el peso. Las cifras se citan de materiales públicos, orientativas.