Glosario de IA
Definiciones claras del vocabulario de IA que aparece en noticias, contratos y documentación de producto.
A
- agente de IA
- Un agente de IA es un modelo de lenguaje conectado a herramientas que puede llamar, dado un objetivo en lugar de una sola pregunta, y permitido para hacer un bucle — llamando a una herramienta, leyendo el resultado, decidiendo el siguiente paso — hasta que juzgue que el objetivo se ha cumplido o alcance un límite. El bucle es lo que distingue a este de un chatbot.
- Ajuste fino
- El ajuste fino continúa entrenando un modelo preentrenado en un conjunto de datos más pequeño y específico para una tarea, ajustando sus pesos para que produzca de manera confiable un formato, tono o habilidad específica particular. Es una forma pobre de enseñar hechos, que cambian y se suministran mejor mediante la recuperación en el momento de la solicitud.
- Alineación
- La alineación es el proceso de moldear el comportamiento de un modelo entrenado para que siga instrucciones, diga la verdad lo mejor que pueda y rechace solicitudes dañinas. Ocurre después del pre-entrenamiento, principalmente a través del ajuste fino supervisado en demostraciones y el aprendizaje por refuerzo a partir de retroalimentación humana o de IA.
- Alucinación
- Una alucinación es una salida que es fluida y segura pero factualmente incorrecta o sin respaldo: una cita inventada, una función inexistente, un número plausible sin fuente. Ocurre porque el modelo genera continuaciones estadísticamente probables, y una afirmación que suena plausible no es necesariamente verdadera.
B
- Benchmark
- Un benchmark es un conjunto fijo de tareas con respuestas conocidas, utilizado para calificar y comparar modelos. Los benchmarks públicos ofrecen una clasificación aproximada de capacidades, pero están fuertemente optimizados, son vulnerables a la contaminación de datos de entrenamiento y se presentan como problemas cortos y bien especificados en lugar de trabajo real en producción.
C
- Cuantización
- La cuantización reduce la precisión numérica de los pesos de un modelo — por ejemplo, de punto flotante de 16 bits a enteros de 8 o 4 bits — para que el modelo ocupe menos memoria y se ejecute más rápido. La pérdida de calidad es pequeña a 8 bits y se vuelve notable, aunque a menudo aceptable, a 4 bits.
D
- Destilación
- La destilación entrena un modelo estudiante más pequeño con las salidas de un modelo profesor más grande, de modo que el estudiante reproduce gran parte del comportamiento del profesor a un costo mucho menor. Es la razón principal por la que los modelos pequeños mejoraron tan rápidamente, y está restringida o prohibida por los términos de muchos API comerciales.
G
- Generación aumentada por recuperación (RAG)
- La generación aumentada por recuperación busca en una colección de documentos pasajes relevantes para una pregunta, los inserta en el prompt del modelo y le pide al modelo que responda utilizándolos. Los pesos del modelo no cambian; el conocimiento llega como contexto en el momento de la solicitud, por lo que actualizar un documento actualiza la respuesta inmediatamente.
I
- Incrustación
- Una incrustación es un vector de longitud fija de números producido por un modelo para representar una pieza de texto, imagen o audio. Los elementos con un significado similar terminan cerca el uno del otro en ese espacio vectorial, lo que hace posible la búsqueda semántica, el agrupamiento y la recomendación.
- Inferencia
- La inferencia es el acto de ejecutar un modelo entrenado sobre una nueva entrada para producir una salida, en contraposición al entrenamiento, que produce el modelo en primer lugar. El entrenamiento es un costo único; la inferencia se repite para cada solicitud y, a lo largo de la vida útil de un modelo ampliamente utilizado, domina tanto el gasto como el consumo de energía.
- Inyección de indicaciones
- La inyección de indicaciones es un ataque en el que se insertan instrucciones en el contenido que un modelo procesa —una página web, un correo electrónico, un documento, un comentario de código— y el modelo las sigue como si hubieran venido de su operador. No hay una forma fiable para que un modelo distinga las instrucciones de confianza del texto que se le pidió leer.
M
- Mezcla de expertos (MoE)
- Mezcla de expertos divide partes de una red en muchas sub-redes paralelas y utiliza un enrutador para enviar cada token a través de solo algunas de ellas. El recuento total de parámetros se mantiene grande mientras que la computación por token se mantiene pequeña, razón por la cual varios modelos muy grandes son más baratos de servir de lo que su tamaño implica.
- Modelo de lenguaje grande (LLM)
- Un modelo de lenguaje grande es una red neuronal con miles de millones de parámetros, entrenada en grandes corpus de texto para predecir el siguiente token en una secuencia. Ese único objetivo, a una escala suficiente, produce la capacidad de responder preguntas, escribir código, traducir y resumir, nada de lo cual fue entrenado directamente.
- Modelo multimodal
- Un modelo multimodal puede procesar más de un tipo de entrada en la misma solicitud, más comúnmente texto junto con imágenes, y cada vez más audio y video. Las entradas no textuales se convierten en la misma representación interna que los tokens, razón por la cual una sola imagen puede consumir una parte sustancial de la ventana de contexto.
P
- Pesos abiertos
- Pesos abiertos significa que el archivo de parámetros entrenados se publica para su descarga, por lo que puede ejecutar, inspeccionar y ajustar el modelo en su propio hardware. La licencia adjunta decide qué puede hacer legalmente con él, y muchos modelos de pesos abiertos se distribuyen bajo licencias personalizadas que no cumplen la definición de código abierto.
- Protocolo de Contexto del Modelo (MCP)
- El Protocolo de Contexto del Modelo es un estándar abierto que define cómo una aplicación de IA descubre y llama a herramientas, recursos y prompts externos. Un servidor lo implementa una vez y cualquier cliente compatible puede usarlo, reemplazando conectores personalizados por producto.
T
- Token
- Un token es la unidad más pequeña de texto que procesa un modelo de lenguaje: un fragmento de palabra común producido por un tokenizador. En inglés, un token promedia aproximadamente cuatro caracteres, o alrededor de 0.75 palabras. Los límites de contexto y los precios de la API se cuentan en tokens, no en palabras.
V
- Ventana de contexto
- La ventana de contexto es el número máximo de tokens que un modelo puede procesar en una sola solicitud. Contiene el prompt del sistema, las definiciones de herramientas, el historial de conversaciones, cualquier documento adjunto y la salida generada. Cualquier cosa fuera de la ventana es invisible para el modelo.