Incrustación
vector embedding · vector representation
En corto
Una incrustación es un vector de longitud fija de números producido por un modelo para representar una pieza de texto, imagen o audio. Los elementos con un significado similar terminan cerca el uno del otro en ese espacio vectorial, lo que hace posible la búsqueda semántica, el agrupamiento y la recomendación.
Un modelo de embeddings lee texto y emite un vector — comúnmente varias centenas a unas pocas mil cifras. La distancia en ese espacio aproxima la similitud de significado, por lo que "cancelar mi suscripción" queda cerca de "cómo doy de baja mi plan" a pesar de compartir casi ninguna palabra.
Esa propiedad es el motor detrás de la búsqueda semántica, la deduplicación, el clustering, la clasificación por vecino más cercano y la parte de recuperación de RAG.
Cuatro puntos prácticos:
- Los espacios vectoriales son específicos del modelo. Los embeddings de diferentes modelos no son comparables, y cambiar de modelo implica volver a generar embeddings de todo.
- El tamaño del chunk influye en la calidad. Los chunks demasiado grandes diluyen la señal; los chunks demasiado pequeños pierden el contexto circundante. Dividir según la estructura del documento suele superar un recuento de caracteres fijo.
- La similitud semántica no es relevancia. Dos pasajes pueden tratar del mismo tema mientras solo uno responde la pregunta. Re‑rankeo con un modelo que puntúa pares consulta‑pasaje directamente soluciona gran parte de esto.
- El emparejamiento exacto necesita palabras clave. Nombres, códigos e identificadores son donde la búsqueda vectorial es más débil y la búsqueda por palabras clave es la más fuerte.
Las llamadas a embeddings son individualmente baratas y colectivamente significativas: re‑indexar un corpus grande después de un cambio de chunking es un verdadero ítem de línea.
Preguntas frecuentes
- ¿Puedo comparar embeddings de dos modelos diferentes?
- No. Cada modelo define su propio espacio vectorial. Cambiar de modelo de incrustación significa volver a incrustar todo el corpus.
- ¿Por qué la búsqueda vectorial omite términos exactos como los números de factura?
- Un identificador tiene poco significado semántico, por lo que su incrustación no es distintiva. La búsqueda por palabras clave lo encuentra inmediatamente, razón por la cual la recuperación híbrida que combina ambas es la opción predeterminada práctica.