Was ist Quantisierung? KI-Modelle schrumpfen, um sie auf dem eigenen Rechner laufen zu lassen
Dass ein riesiges 70B-Modell auf einem einzelnen heimischen Gaming-PC statt auf einem Rack voller Rechenzentrums-GPUs läuft, ermöglicht die Quantisierung, die die numerische Präzision der Gewichte eines Modells senkt, um Größe und Speicher drastisch zu verringern. Während die Modell-Destillation Wissen in ein separates kleineres Modell verlagert, macht die Quantisierung dasselbe Modell leichter. Dieser Artikel erklärt sie mit einer Foto-Kompressions-Analogie. Die Quantisierung ersetzt als FP16/FP32-Dezimalzahlen gespeicherte Gewichte durch INT8 (8-bit) oder INT4 (4-bit) Ganzzahlen und reduziert die Bytes pro Gewicht (FP32=4, INT8=1, INT4=0,5); wie beim Komprimieren eines RAW-Fotos zu JPEG opferst du ein wenig Präzision für eine große Reduktion, und überraschend ist, wie wenig man aufgibt. Beim Speicher nutzt 4-bit etwa ein Viertel von FP16: ein 70B-Modell sinkt von ~140GB auf ~35GB, und ein 8B-Modell bei 4-bit liegt bei ~4.5-5GB und passt in eine Mittelklasse-GPU mit 8GB VRAM für lokale Nutzung (die Demokratisierung der LLMs). Bei der Genauigkeit ist INT8 nahezu verlustfrei und INT4 verschlechtert sich unter 4% bei allgemeinen Q&A-/Alltagsaufgaben, doch der Verlust ist bei Mathematik, Code-Generierung und schwierigem Schlussfolgern deutlicher (er zeigt sich als kleiner Anstieg der Perplexität), also wähle die Bit-Breite passend zur Aufgabe. Wichtigste Methoden: GPTQ (Vorreiter für genaues 4-bit), AWQ (schützt die ~1% wichtigsten Gewichte, oft 1-2% genauer und schneller), GGUF (llama.cpp/Ollama-Format, Q2_K-Q8_0, CPU+GPU-Hybrid, für lokal) und QLoRA (4-bit-Basis plus LoRA für Consumer-GPU-Fine-Tuning). Sie unterscheidet sich von Destillation (in ein separates kleines Modell verlagern) und Fine-Tuning (Aufgabenwissen hinzufügen), und die drei werden meist kombiniert (ein destilliertes Modell quantisieren; eine quantisierte Basis fine-tunen). Zum Start ein GGUF-Modell mit Ollama in einem Befehl ausführen, Q4/Q8 nach VRAM wählen und INT4 für Code oder exakte Mathematik vermeiden. Die meisten großen Modelle werden bereits quantisiert ausgeliefert, du lädst sie also einfach herunter und nutzt sie. Behalte die Klugheit, lass nur das Gewicht fallen. Die Zahlen sind aus öffentlichen Materialien zitiert, als Richtwert.