Skip to content
DigitalNeuron
Chips & Infrastruktur

Quantisierung

quantization · INT8 · INT4

Kurz gesagt

Quantisierung reduziert die numerische Präzision der Gewichte eines Modells – zum Beispiel von 16-Bit-Gleitkommazahlen auf 8-Bit- oder 4-Bit-Integer – sodass das Modell weniger Speicherplatz benötigt und schneller läuft. Der Qualitätsverlust ist bei 8-Bit gering und wird bei 4-Bit spürbar, wenn auch oft akzeptabel.

Die Gewichte eines Modells werden als Zahlen gespeichert. Das Training verwendet typischerweise 16-Bit-Gleitkommazahlen. Quantisierung kodiert sie mit geringerer Präzision neu – üblich sind 8-Bit- oder 4-Bit-Integer – mit Skalierungsfaktoren, die den reduzierten Bereich zurück auf den ursprünglichen abbilden.

Zwei Vorteile ergeben sich, wobei der zweite der wichtigere ist. Der Speicherbedarf schrumpft ungefähr proportional, sodass ein Modell, das mehrere Beschleuniger benötigte, auf einen passen kann. Und da die Inferenz durch die Speicherbandbreite und nicht durch die Arithmetik begrenzt ist, erhöht das Verschieben von weniger Bytes pro Token direkt die Generierungsgeschwindigkeit.

Die Methoden unterscheiden sich darin, wo die Arbeit stattfindet. Post-Training Quantisierung konvertiert ein bereits trainiertes Modell und verwendet manchmal einen kleinen Kalibrierungsdatensatz zur Auswahl der Skalierungsfaktoren. Quantisierungsbewusstes Training simuliert die reduzierte Präzision während des Trainings, sodass sich das Modell daran anpasst, was bei sehr niedrigen Bitbreiten zu besseren Ergebnissen bei deutlich höherem Aufwand führt.

Die praktische Vorsichtsmaßnahme ist, dass veröffentlichte Qualitätsaussagen Durchschnittswerte über allgemeine Benchmarks sind. Die Verschlechterung ist nicht einheitlich: Aufgaben mit langem Kontext und mehrstufigem Schlussfolgern leiden tendenziell zuerst. Wenn die Quantisierung Teil Ihres Kostenplans ist, messen Sie sie auf Ihrem eigenen Evaluationsdatensatz, bevor Sie sich festlegen.

Häufige Fragen

Wie viel Qualität geht verloren?
Bei 8 Bit, normalerweise wenig genug, um bei gewöhnlichen Aufgaben schwer zu erkennen. Bei 4 Bit ist die Verschlechterung messbar und zeigt sich zuerst bei rechenintensiven und Langzeit-Kontext-Aufgaben. Bewerten Sie immer anhand Ihrer eigenen Aufgaben, anstatt allgemeinen Behauptungen zu vertrauen.
Warum macht Quantisierung die Inferenz schneller?
Die Token-Generierung wird durch die Speicherbandbreite begrenzt, nicht durch die Arithmetik. Kleinere Gewichte bedeuten weniger Daten, die pro Token bewegt werden, sodass das Modell schneller Ausgaben produziert, obwohl die Anzahl der Operationen unverändert bleibt.

Siehe auch

Zuletzt aktualisiert am 22. Aug. 2026