Modelo de lenguaje grande (LLM)
LLM · foundation model
En corto
Un modelo de lenguaje grande es una red neuronal con miles de millones de parámetros, entrenada en grandes corpus de texto para predecir el siguiente token en una secuencia. Ese único objetivo, a una escala suficiente, produce la capacidad de responder preguntas, escribir código, traducir y resumir, nada de lo cual fue entrenado directamente.
Un modelo de lenguaje grande se entrena en una tarea: dada una secuencia de tokens, predecir el siguiente. Repite eso en un corpus enorme y los parámetros del modelo llegan a codificar gramática, hechos, patrones de razonamiento, convenciones de código y una gran cantidad de estilo de escritura humana acumulado.
La mayoría de los LLM modernos utilizan la arquitectura transformer, cuyo mecanismo de atención permite que cada posición en la entrada influya en todas las demás. Eso es lo que hace posible la coherencia a largo plazo y lo que hace que el cálculo crezca con la longitud de la secuencia.
El entrenamiento se realiza en etapas. El pre-entrenamiento en texto amplio produce una capacidad bruta. El post-entrenamiento —ajuste fino supervisado en demostraciones, luego aprendizaje por refuerzo a partir de retroalimentación humana o de IA— convierte a un predictor de texto en algo que sigue instrucciones y rechaza solicitudes dañinas.
Dos propiedades importan en la práctica. El modelo es sin estado: no recuerda nada entre solicitudes excepto lo que pones en la ventana de contexto. Y es probabilístico: la misma indicación puede producir resultados diferentes, y la confianza en su tono no lleva información sobre la corrección.
Preguntas frecuentes
- ¿Un LLM entiende lo que escribe?
- No tiene creencias ni intenciones en el sentido humano. Modela la estructura estadística del lenguaje lo suficientemente bien como para que su salida sea a menudo correcta y útil, y con confianza errónea cuando la estructura apunta en la dirección equivocada.
- ¿Qué hace que un modelo de lenguaje sea 'grande'?
- Recuento de parámetros, volumen de datos de entrenamiento y cómputo de entrenamiento, todo muy por encima de los modelos anteriores. No hay un umbral formal; el término es comparativo y su línea de base sigue moviéndose.