Skip to content
DigitalNeuron
Modelle & Forschung

Einbettung

vector embedding · vector representation

Kurz gesagt

Ein Embedding ist ein fester Längenvektor von Zahlen, der von einem Modell erzeugt wird, um ein Stück Text, Bild oder Audio darzustellen. Objekte mit ähnlichem Sinn enden nahe beieinander im Vektorraum, was semantische Suche, Clustering und Empfehlungen ermöglicht.

Ein Embedding‑Modell liest Text und gibt einen Vektor aus — häufig mehrere hundert bis tausend Zahlen. Der Abstand in diesem Raum approximiert die semantische Ähnlichkeit, sodass „cancel my subscription“ nahe bei „how do I end my plan“ liegt, obwohl sie fast keine gemeinsamen Wörter teilen.

Diese Eigenschaft ist das Herzstück von semantischer Suche, Deduplizierung, Clustering, Klassifizierung per naheliegendem Nachbarn und dem Abruf‑Teil von RAG.

Vier praktische Punkte:

  • Vektorräume sind modellabhängig. Embeddings von verschiedenen Modellen sind nicht vergleichbar, und ein Modellwechsel bedeutet, alles neu zu embedden.
  • Chunk‑Größe beeinflusst Qualität. Zu große Chunks verwässern das Signal; zu kleine Chunks verlieren den Kontext. Das Aufteilen nach Dokumentstruktur schlägt meist ein festes Zeichenlimit.
  • Semantische Ähnlichkeit ist nicht Relevanz. Zwei Abschnitte können zu einem Thema gehören, während nur einer die Frage beantwortet. Reranking mit einem Modell, das Abfrage‑Abschnittspaare direkt bewertet, löst viel davon.
  • Genauere Übereinstimmung benötigt Keywords. Namen, Codes und Bezeichner sind Schwachstellen für Vektor‑Suche und Stärken für Keyword‑Suche.

Einbettungsaufrufe sind einzeln günstig und kollektiv bedeutend: Das Neuinndizieren eines großen Korpus nach einer Änderung des Chunkings ist ein echter Posten.

Häufige Fragen

Kann ich Embeddings von zwei verschiedenen Modellen vergleichen?
Nein. Jedes Modell definiert seinen eigenen Vektorraum. Das Wechseln von Embedding-Modellen bedeutet, den gesamten Korpus neu einzubetten.
Warum verpasst die Vektorsuche exakte Begriffe wie Rechnungsnummern?
Ein Bezeichner trägt wenig semantische Bedeutung, daher ist seine Einbettung nicht aussagekräftig. Die Stichwortsuche findet ihn sofort, weshalb die hybride Suche, die beides kombiniert, der praktische Standard ist.

Siehe auch

Zuletzt aktualisiert am 22. Aug. 2026