Skip to content
DigitalNeuron
Modelos e investigación

Generación aumentada por recuperación (RAG)

RAG · grounding

En corto

La generación aumentada por recuperación busca en una colección de documentos pasajes relevantes para una pregunta, los inserta en el prompt del modelo y le pide al modelo que responda utilizándolos. Los pesos del modelo no cambian; el conocimiento llega como contexto en el momento de la solicitud, por lo que actualizar un documento actualiza la respuesta inmediatamente.

RAG tiene dos mitades. Con antelación, los documentos se dividen en fragmentos, se convierten en embeddings y se indexan. En el momento de la consulta, se incrusta la pregunta, se recuperan los fragmentos más cercanos —generalmente combinados con búsqueda por palabras clave— y se pegan en el prompt junto con instrucciones para responder solo a partir de ellos y citar las fuentes.

La razón por la que domina las implementaciones empresariales es operativa más que técnica: el conocimiento reside en su almacén de documentos. Cambie el documento y la siguiente respuesta cambia. Sin reentrenamiento, sin demoras, y los permisos se pueden aplicar en el momento de la recuperación para que un usuario nunca vea pasajes a los que no tiene derecho.

El modo de fallo se concentra en un solo lugar. La mayoría de los problemas de RAG son problemas de búsqueda. La similitud vectorial pura es débil en identificadores exactos —números de factura, códigos de producto, nombres de personas— donde la búsqueda por palabras clave sobresale, por lo que la recuperación híbrida que ejecuta ambas y fusiona las clasificaciones se ha convertido en el valor predeterminado práctico. Los límites de los fragmentos que dividen una definición de su excepción, los filtros de metadatos faltantes y la recuperación de muy pocos candidatos representan la mayoría del resto.

Evalúe la recuperación por separado de la generación, con pares de pregunta y pasaje correcto. Los equipos que solo juzgan las respuestas finales no pueden decir qué mitad arreglar. Vea la explicación completa sobre cómo funciona RAG.

Preguntas frecuentes

¿Es RAG mejor que el ajuste fino?
Abordan diferentes problemas. RAG suministra hechos que el modelo no tiene; el ajuste fino moldea el formato, el tono o una habilidad específica. El conocimiento faltante es un problema de RAG.
¿Por qué un sistema RAG todavía da respuestas incorrectas?
Casi siempre porque la recuperación devolvió los pasajes incorrectos. Comprueba lo que se recuperó realmente antes de culpar al modelo; si un humano cuidadoso no hubiera podido responder a partir de esos pasajes, el modelo nunca tuvo una oportunidad.

Véase también

Última actualización: 22 ago 2026