Ventana de contexto
context length · context limit
En corto
La ventana de contexto es el número máximo de tokens que un modelo puede procesar en una sola solicitud. Contiene el prompt del sistema, las definiciones de herramientas, el historial de conversaciones, cualquier documento adjunto y la salida generada. Cualquier cosa fuera de la ventana es invisible para el modelo.
La ventana de contexto es un límite estricto y es un presupuesto compartido. Todo compite por el mismo espacio: instrucciones del sistema, esquemas de herramientas, la conversación hasta ahora, pasajes recuperados, archivos adjuntos y la respuesta que se está generando.
Ese último elemento sorprende a la gente. Una entrada muy larga puede dejar espacio insuficiente para una respuesta larga, produciendo una salida que se detiene a mitad de frase sin razón aparente.
Los contextos largos también se degradan de manera desigual. La investigación sobre el comportamiento de contextos largos encontró una curva de precisión en forma de U: los hechos al principio y al final de una entrada larga se recuperan de manera mucho más confiable que los hechos en el medio. Las reglas prácticas se derivan directamente: instrucciones primero, la pregunta inmediata al final y sin relleno.
El costo sigue el mismo presupuesto. La mayoría de las API de chat reenvían toda la conversación en cada turno, por lo que un hilo largo se vuelve más caro de lo que sugiere el número de mensajes. El caché de prompts reduce el precio de un prefijo sin cambios, pero solo cuando ese prefijo es byte a byte idéntico entre solicitudes.
El remedio habitual para alcanzar el límite no es una ventana más grande, sino la recuperación: recuperar los pocos pasajes que se relacionan con la pregunta y enviarlos.
Preguntas frecuentes
- ¿Una ventana de contexto más grande significa mejores respuestas?
- No automáticamente. Los modelos recuperan información colocada cerca del principio y el final de una entrada larga de manera más confiable que el material en el medio, por lo que la relevancia importa más que el volumen.
- ¿Qué sucede cuando una conversación excede la ventana?
- La aplicación debe descartar, resumir o externalizar turnos más antiguos. El modelo no puede ver nada fuera de la ventana y no le advertirá que algo fue eliminado.