KI-Glossar
Klare Definitionen des KI-Vokabulars aus Nachrichten, Verträgen und Produktdokumentation.
A
- Ausrichtung
- Alignment ist der Prozess, das Verhalten eines trainierten Modells so zu gestalten, dass es Anweisungen befolgt, nach bestem Wissen die Wahrheit sagt und schädliche Anfragen ablehnt. Es geschieht nach dem Vortraining, hauptsächlich durch überwachtes Fine-Tuning anhand von Demonstrationen und Reinforcement Learning aus menschlichem oder KI-Feedback.
B
- Benchmark
- Ein Benchmark ist eine feste Reihe von Aufgaben mit bekannten Antworten, die verwendet wird, um Modelle zu bewerten und zu vergleichen. Öffentliche Benchmarks geben ein grobes Fähigkeitsranking, sind aber stark optimiert, anfällig für Trainingsdaten-Kontamination und ähneln eher kurzen, gut spezifizierten Problemen als realer Produktionsarbeit.
D
- Destillation
- Destillation trainiert ein kleineres Studentenmodell anhand der Ausgaben eines größeren Lehrermodells, sodass der Student einen Großteil des Verhaltens des Lehrers zu weitaus geringeren Kosten reproduziert. Dies ist der Hauptgrund dafür, dass kleine Modelle so schnell besser wurden, und es ist durch die Nutzungsbedingungen vieler kommerzieller APIs eingeschränkt oder verboten.
E
- Einbettung
- Ein Embedding ist ein fester Längenvektor von Zahlen, der von einem Modell erzeugt wird, um ein Stück Text, Bild oder Audio darzustellen. Objekte mit ähnlichem Sinn enden nahe beieinander im Vektorraum, was semantische Suche, Clustering und Empfehlungen ermöglicht.
F
- Feinabstimmung
- Fine-Tuning setzt das Training eines vortrainierten Modells auf einem kleineren, aufgaben-spezifischen Datensatz fort und passt dessen Gewichte an, damit es zuverlässig ein bestimmtes Format, einen bestimmten Ton oder eine spezifische Fähigkeit erzeugt. Es ist eine schlechte Methode, um Fakten zu vermitteln, da sich diese ändern und besser durch Abruf zum Zeitpunkt der Anfrage bereitgestellt werden.
G
- Großes Sprachmodell (LLM)
- Ein großes Sprachmodell ist ein neuronales Netz mit Milliarden von Parametern, das auf großen Textkorpora trainiert wurde, um das nächste Token in einer Sequenz vorherzusagen. Dieses einzelne Ziel, in ausreichendem Umfang, führt zur Fähigkeit, Fragen zu beantworten, Code zu schreiben, zu übersetzen und zusammenzufassen – keines davon wurde direkt dafür trainiert.
H
- Halluzination
- Eine Halluzination ist eine Ausgabe, die flüssig und selbstbewusst, aber sachlich falsch oder unbelegt ist – eine erfundene Zitation, eine nicht existierende Funktion, eine plausible Zahl ohne Quelle. Sie tritt auf, weil das Modell statistisch wahrscheinliche Fortsetzungen generiert, und eine plausibel klingende Behauptung ist nicht zwangsläufig wahr.
I
- Inferenz
- Inferenz ist der Vorgang, bei dem ein trainiertes Modell mit neuen Eingaben ausgeführt wird, um Ausgaben zu erzeugen, im Gegensatz zum Training, das das Modell überhaupt erst erzeugt. Training ist eine einmalige Kostenbelastung; Inferenz wiederholt sich für jede Anfrage, und im Laufe des Lebens eines weit verbreiteten Modells dominiert sie sowohl die Ausgaben als auch den Energieverbrauch.
K
- KI-Agent
- Ein KI-Agent ist ein Sprachmodell, das mit Tools verbunden ist, die es aufrufen kann, ein Ziel anstelle einer einzelnen Frage erhält und erlaubt, zu iterieren — ein Tool aufzurufen, das Ergebnis zu lesen, den nächsten Schritt zu entscheiden — bis es das Ziel erreicht hat oder eine Grenze überschreitet. Die Schleife ist das, was ihn von einem Chatbot unterscheidet.
- Kontextfenster
- Das Kontextfenster ist die maximale Anzahl von Tokens, die ein Modell in einer einzigen Anfrage verarbeiten kann. Es enthält den System-Prompt, Tool-Definitionen, den Gesprächsverlauf, alle angehängten Dokumente und die generierte Ausgabe. Alles außerhalb des Fensters ist für das Modell unsichtbar.
M
- Mixture of Experts (MoE)
- Mixture of Experts teilt Teile eines Netzwerks in viele parallele Teilnetzwerke auf und verwendet einen Router, um jedes Token nur durch einige davon zu leiten. Die Gesamtzahl der Parameter bleibt groß, während die Berechnung pro Token klein bleibt, weshalb mehrere sehr große Modelle günstiger zu bedienen sind, als ihre Größe vermuten lässt.
- Model Context Protocol (MCP)
- Das Model Context Protocol ist ein offener Standard, der definiert, wie eine KI-Anwendung externe Tools, Ressourcen und Prompts entdeckt und aufruft. Ein Server implementiert es einmal und jeder kompatible Client kann es nutzen, wodurch produktspezifische benutzerdefinierte Konnektoren ersetzt werden.
- Multimodales Modell
- Ein multimodales Modell kann mehr als eine Art von Eingabe in derselben Anfrage verarbeiten, am häufigsten Text zusammen mit Bildern und zunehmend auch Audio und Video. Nicht-Text-Eingaben werden in dieselbe interne Darstellung wie Tokens umgewandelt, weshalb ein einzelnes Bild einen erheblichen Teil des Kontextfensters beanspruchen kann.
O
- Offene Gewichte
- Offene Gewichte bedeuten, dass die trainierte Parameterdatei zum Download veröffentlicht wird, sodass Sie das Modell auf Ihrer eigenen Hardware ausführen, inspizieren und feinabstimmen können. Die angehängte Lizenz entscheidet, was Sie damit rechtlich tun dürfen, und viele Modelle mit offenen Gewichten werden unter benutzerdefinierten Lizenzen vertrieben, die nicht der Open-Source-Definition entsprechen.
P
- Prompt-Injection
- Prompt-Injection ist ein Angriff, bei dem Anweisungen in Inhalte eingebettet werden, die ein Modell verarbeitet – eine Webseite, eine E-Mail, ein Dokument, ein Code-Kommentar – und das Modell diesen Anweisungen folgt, als kämen sie von seinem Betreiber. Es gibt keine zuverlässige Möglichkeit für ein Modell, vertrauenswürdige Anweisungen von Text zu unterscheiden, den es lesen sollte.
Q
- Quantisierung
- Quantisierung reduziert die numerische Präzision der Gewichte eines Modells – zum Beispiel von 16-Bit-Gleitkommazahlen auf 8-Bit- oder 4-Bit-Integer – sodass das Modell weniger Speicherplatz benötigt und schneller läuft. Der Qualitätsverlust ist bei 8-Bit gering und wird bei 4-Bit spürbar, wenn auch oft akzeptabel.
R
- Retrieval-augmented generation (RAG)
- Retrieval-augmented Generation durchsucht eine Dokumentensammlung nach für eine Frage relevanten Passagen, fügt diese in den Prompt des Modells ein und bittet das Modell, diese zu verwenden, um die Frage zu beantworten. Die Gewichte des Modells bleiben unverändert; das Wissen kommt als Kontext zur Anfragezeit an, sodass die Aktualisierung eines Dokuments die Antwort sofort aktualisiert.
T
- Token
- Ein Token ist die kleinste Texteinheit, die ein Sprachmodell verarbeitet: ein gängiger Wortteil, der von einem Tokenizer erzeugt wird. Im Englischen entspricht ein Token im Durchschnitt etwa vier Zeichen oder etwa 0,75 Wörtern. Kontextgrenzen und API-Preise werden beide in Tokens, nicht in Wörtern, gezählt.