Skip to content
DigitalNeuron
Modelle & Forschung

Retrieval-augmented generation (RAG)

RAG · grounding

Kurz gesagt

Retrieval-augmented Generation durchsucht eine Dokumentensammlung nach für eine Frage relevanten Passagen, fügt diese in den Prompt des Modells ein und bittet das Modell, diese zu verwenden, um die Frage zu beantworten. Die Gewichte des Modells bleiben unverändert; das Wissen kommt als Kontext zur Anfragezeit an, sodass die Aktualisierung eines Dokuments die Antwort sofort aktualisiert.

RAG hat zwei Hälften. Im Voraus werden Dokumente in Chunks aufgeteilt, in Embeddings umgewandelt und indiziert. Zur Abfragezeit wird die Frage eingebettet, die nächsten Chunks werden abgerufen – normalerweise kombiniert mit Stichwortsuche – und zusammen mit Anweisungen, nur aus ihnen zu antworten und Quellen zu zitieren, in den Prompt eingefügt.

Der Grund, warum es bei Enterprise-Bereitstellungen dominiert, ist eher operativer als technischer Natur: Das Wissen lebt in Ihrem Dokumentenspeicher. Ändern Sie das Dokument, ändert sich die nächste Antwort. Kein erneutes Training, keine Verzögerung, und Berechtigungen können zur Abrufzeit durchgesetzt werden, sodass ein Benutzer niemals Passagen sieht, zu denen er nicht berechtigt ist.

Der Fehlerfall konzentriert sich an einem Ort. Die meisten RAG-Probleme sind Suchprobleme. Reine Vektorsimilarität ist schwach bei exakten Identifikatoren – Rechnungsnummern, Produktcodes, Personennamen –, bei denen die Stichwortsuche glänzt. Deshalb ist hybrides Abrufen, das beides ausführt und die Ranglisten zusammenführt, zum praktischen Standard geworden. Chunk-Grenzen, die eine Definition von ihrer Ausnahme trennen, fehlende Metadatenfilter und das Abrufen zu weniger Kandidaten machen den Rest aus.

Bewerten Sie den Abruf getrennt von der Generierung, mit Frage-und-korrekt-Passagen-Paaren. Teams, die nur die endgültigen Antworten beurteilen, können nicht sagen, welche Hälfte sie beheben müssen. Sehen Sie die vollständige Erklärung, wie RAG funktioniert, unter how RAG works.

Häufige Fragen

Ist RAG besser als Fine-Tuning?
Sie adressieren unterschiedliche Probleme. RAG liefert Fakten, die das Modell nicht hat; Fine-Tuning formt Format, Ton oder eine spezifische Fähigkeit. Fehlendes Wissen ist ein RAG-Problem.
Warum gibt ein RAG-System immer noch falsche Antworten?
Fast immer, weil die Abfrage die falschen Passagen zurückgegeben hat. Überprüfen Sie, was tatsächlich abgerufen wurde, bevor Sie dem Modell die Schuld geben – wenn ein sorgfältiger Mensch die Frage anhand dieser Passagen nicht hätte beantworten können, hatte das Modell nie eine Chance.

Siehe auch

Zuletzt aktualisiert am 22. Aug. 2026