Inferencia
serving · generation
En corto
La inferencia es el acto de ejecutar un modelo entrenado sobre una nueva entrada para producir una salida, en contraposición al entrenamiento, que produce el modelo en primer lugar. El entrenamiento es un costo único; la inferencia se repite para cada solicitud y, a lo largo de la vida útil de un modelo ampliamente utilizado, domina tanto el gasto como el consumo de energía.
La inferencia se divide en dos fases con diferentes características de rendimiento.
Prefill procesa toda la entrada a la vez. Se paraleliza bien y está limitada por el cómputo, por lo que escala con la longitud de la entrada y determina cuánto tiempo espera el usuario el primer token.
Decode genera la salida un token a la vez, y cada paso requiere un pase completo por los pesos del modelo. Está limitada por el ancho de banda de la memoria y establece la velocidad de palabras por segundo que percibe el usuario.
La mayoría de las optimizaciones de servicio atacan una de estas fases. Batching continuo mantiene los aceleradores ocupados fusionando solicitudes que llegan en diferentes momentos. Caché KV almacena el estado de atención intermedio para que los tokens anteriores no se recalculen en cada paso. Decodificación especulativa tiene un modelo pequeño que redacta varios tokens que el modelo grande verifica en un solo pase. [Cuantización](/en/glossary/quantization) reduce los pesos para que quepa más en la memoria rápida. [Mezcla de expertos](/en/glossary/mixture-of-experts) dirige cada token a través de solo una parte de la red.
La consecuencia económica es que la eficiencia de la inferencia, no el tamaño del modelo, determina si un producto de IA tiene un margen viable, y las mismas optimizaciones que reducen el costo también reducen el consumo de energía.
Preguntas frecuentes
- ¿Por qué el primer token es más lento que el resto?
- El modelo debe procesar toda la entrada antes de generar nada: la fase de prellenado. Después de eso, los tokens se producen uno a la vez en la fase de decodificación, que está limitada por el ancho de banda de la memoria en lugar de la potencia de cálculo bruta.
- ¿La inferencia cuesta más que el entrenamiento en general?
- Para cualquier modelo en uso real en producción, sí. El entrenamiento es finito; la inferencia se repite indefinidamente, y el costo acumulado de la inferencia supera al del entrenamiento bien dentro de la vida útil de un modelo.