Kontextfenster
context length · context limit
Kurz gesagt
Das Kontextfenster ist die maximale Anzahl von Tokens, die ein Modell in einer einzigen Anfrage verarbeiten kann. Es enthält den System-Prompt, Tool-Definitionen, den Gesprächsverlauf, alle angehängten Dokumente und die generierte Ausgabe. Alles außerhalb des Fensters ist für das Modell unsichtbar.
Das Kontextfenster ist eine harte Obergrenze und ein gemeinsames Budget. Alles konkurriert um denselben Platz: Systemanweisungen, Tool-Schemata, die bisherige Konversation, abgerufene Passagen, angehängte Dateien und die generierte Antwort.
Der letzte Punkt überrascht viele. Eine sehr lange Eingabe kann zu wenig Platz für eine lange Antwort lassen, was zu einer Ausgabe führt, die ohne ersichtlichen Grund mitten im Satz abbricht.
Lange Kontexte verschlechtern sich ebenfalls ungleichmäßig. Forschungen zum Verhalten bei langen Kontexten ergaben eine U-förmige Genauigkeitskurve: Fakten am Anfang und Ende einer langen Eingabe werden weitaus zuverlässiger wiederhergestellt als Fakten in der Mitte. Daraus ergeben sich direkt praktische Regeln: Anweisungen zuerst, die unmittelbare Frage zuletzt und kein Auffüllen.
Die Kosten folgen demselben Budget. Die meisten Chat-APIs senden die gesamte Konversation bei jedem Durchgang erneut, sodass ein langer Thread schneller teuer wird, als die Anzahl der Nachrichten vermuten lässt. Prompt-Caching reduziert den Preis eines unveränderten Präfixes, aber nur, wenn dieses Präfix zwischen den Anfragen Byte für Byte identisch ist.
Das übliche Mittel, um das Limit zu erreichen, ist kein größeres Fenster, sondern Retrieval: Holen Sie die wenigen Passagen, die für die Frage relevant sind, und senden Sie diese.
Häufige Fragen
- Bedeutet ein größeres Kontextfenster bessere Antworten?
- Nicht automatisch. Modelle rufen Informationen, die sich am Anfang und Ende einer langen Eingabe befinden, zuverlässiger ab als Material in der Mitte, daher ist Relevanz wichtiger als Umfang.
- Was passiert, wenn ein Gespräch das Fenster überschreitet?
- Die Anwendung muss ältere Runden verwerfen, zusammenfassen oder extern speichern. Das Modell kann nichts außerhalb des Fensters sehen und wird Sie nicht warnen, dass etwas entfernt wurde.