Benchmark
eval · evaluation set · leaderboard
En corto
Un benchmark es un conjunto fijo de tareas con respuestas conocidas, utilizado para calificar y comparar modelos. Los benchmarks públicos ofrecen una clasificación aproximada de capacidades, pero están fuertemente optimizados, son vulnerables a la contaminación de datos de entrenamiento y se presentan como problemas cortos y bien especificados en lugar de trabajo real en producción.
Los benchmarks existen porque la comparación de modelos necesita un punto de referencia común, y son genuinamente útiles para ello: establecen un orden aproximado y detectan regresiones importantes.
También fallan de maneras predecibles, todas atribuibles a una única dinámica: una vez que un número se convierte en un objetivo, deja de ser una medida.
- Contaminación. Los benchmarks públicos están en la web pública, y los corpus de entrenamiento se extraen de la web pública.
- Presión de optimización. Los proveedores ajustan sus modelos contra los benchmarks con los que serán evaluados. Esto es racional e infla las puntuaciones en relación con la capacidad no probada.
- Forma de la tarea. Corta, de un solo turno, sin ambigüedades, con una única respuesta correcta. Poco trabajo de producción se parece a eso.
- Informes selectivos. Cada lanzamiento muestra los benchmarks que gana.
- Saturación. Una vez que todos los modelos creíbles obtienen una puntuación superior al 90%, las diferencias restantes son ruido.
La alternativa no es abandonar los benchmarks, sino añadir los propios. Unos cientos de solicitudes reales de tu tráfico, con respuestas correctas acordadas por personas que conocen el dominio, evaluadas de la misma manera cada vez. Ese conjunto responde a la pregunta que realmente tienes: qué modelo es mejor para esto, y es el único que sobrevive a una actualización del modelo.
Los equipos que crean uno encuentran rutinariamente que el orden difiere del de la tabla de clasificación, a veces a favor del modelo más barato.
Preguntas frecuentes
- ¿Por qué los líderes de benchmark a veces decepcionan en producción?
- Los benchmarks premian tareas cortas, inequívocas y de un solo turno. El trabajo de producción es largo, ambiguo, de múltiples turnos y adversarial. La correlación entre ambos es real pero laxa.
- ¿Qué es la contaminación de benchmarks?
- Preguntas y respuestas de referencia que aparecen en los datos de entrenamiento de un modelo, generalmente porque se publicaron en la web. Un benchmark contaminado mide la recuperación en lugar de la capacidad, y no se puede descartar por completo.