Cuantización
quantization · INT8 · INT4
En corto
La cuantización reduce la precisión numérica de los pesos de un modelo — por ejemplo, de punto flotante de 16 bits a enteros de 8 o 4 bits — para que el modelo ocupe menos memoria y se ejecute más rápido. La pérdida de calidad es pequeña a 8 bits y se vuelve notable, aunque a menudo aceptable, a 4 bits.
Los pesos de un modelo se almacenan como números. El entrenamiento suele utilizar punto flotante de 16 bits. La cuantización los recodifica a menor precisión —enteros de 8 o 4 bits son comunes— con factores de escala que mapean el rango reducido de vuelta al original.
De esto se derivan dos beneficios, siendo el segundo el más importante. La memoria se reduce aproximadamente en proporción, por lo que un modelo que necesitaba varios aceleradores puede caber en uno. Y dado que la decodificación está limitada por el ancho de banda de la memoria en lugar de la aritmética, mover menos bytes por token aumenta directamente la velocidad de generación.
Los métodos difieren en dónde ocurre el trabajo. La cuantización post-entrenamiento convierte un modelo ya entrenado, a veces utilizando un pequeño conjunto de datos de calibración para elegir los factores de escala. El entrenamiento consciente de la cuantización simula la precisión reducida durante el entrenamiento para que el modelo se adapte a ella, ofreciendo mejores resultados con anchos de bits muy bajos a cambio de un esfuerzo considerablemente mayor.
La precaución práctica es que las afirmaciones de calidad publicadas son promedios sobre puntos de referencia generales. La degradación no es uniforme: las tareas de contexto largo y razonamiento de múltiples pasos tienden a sufrir primero. Si la cuantización forma parte de su plan de costos, mídala en su propio conjunto de evaluación antes de comprometerse.
Preguntas frecuentes
- ¿Cuánta calidad se pierde?
- En 8 bits, generalmente es lo suficientemente poco como para ser difícil de detectar en tareas ordinarias. En 4 bits, la degradación es medible y aparece primero en trabajos que requieren mucha razonamiento y contexto largo. Siempre evalúa en tus propias tareas en lugar de confiar en una afirmación general.
- ¿Por qué la cuantización hace que la inferencia sea más rápida?
- La generación de tokens está limitada por el ancho de banda de la memoria, no por la aritmética. Pesos más pequeños significan menos datos movidos por token, por lo que el modelo produce salida más rápido a pesar de que el número de operaciones no cambia.