Skip to content
DigitalNeuron
Seguridad y ética

Alineación

RLHF · post-training · safety tuning

En corto

La alineación es el proceso de moldear el comportamiento de un modelo entrenado para que siga instrucciones, diga la verdad lo mejor que pueda y rechace solicitudes dañinas. Ocurre después del pre-entrenamiento, principalmente a través del ajuste fino supervisado en demostraciones y el aprendizaje por refuerzo a partir de retroalimentación humana o de IA.

Un modelo recién salido del preentrenamiento predice texto. No sigue instrucciones, no prefiere la verdad a la plausibilidad y no tiene noción de lo que debería rechazar. La alineación es lo que convierte eso en un asistente.

El pipeline estándar tiene dos etapas. El ajuste fino supervisado entrena con ejemplos curados de buenas respuestas. La optimización de preferencias —RLHF, o métodos como DPO que omiten el modelo de recompensa separado— entrena al modelo para que prefiera las respuestas que las personas calificaron más alto.

Los enfoques constitucionales sustituyen un conjunto escrito de principios a gran parte del etiquetado humano: el modelo critica y revisa sus propias salidas contra reglas establecidas, produciendo datos de preferencia a escala.

Hay dos límites sobre los que vale la pena ser claro. La alineación es conductual, no epistémica —hace que un modelo actúe de manera útil y rechace apropiadamente; no le da un mecanismo para saber si una afirmación es cierta, razón por la cual la alucinación persiste. Y es disputada: de quién son los valores, qué rechazos y cuánta precaución antes de que un modelo se vuelva inútil son preguntas sin respuesta técnica.

El programa de investigación se extiende mucho más allá del comportamiento del producto —interpretabilidad, evaluación de capacidades peligrosas, supervisión escalable— pero en el uso comercial, "alineado" generalmente significa la cosa más estrecha descrita anteriormente.

Preguntas frecuentes

¿Qué es RLHF?
Aprendizaje por refuerzo a partir de retroalimentación humana: las personas clasifican respuestas alternativas del modelo, se entrena un modelo de recompensa con esas clasificaciones y el modelo se optimiza contra él. Las variantes reemplazan algunas clasificaciones humanas con otras generadas por IA.
¿Hace que la alineación sea un modelo menos capaz?
Puede, en los márgenes — la rechazo excesivamente cauteloso de solicitudes inocuas es la queja usual. Equilibrar la utilidad contra la cautela es un compromiso de ajuste explícito, no un accidente.

Véase también

Última actualización: 22 ago 2026