Skip to content
DigitalNeuron
Modelle & Forschung

Großes Sprachmodell (LLM)

LLM · foundation model

Kurz gesagt

Ein großes Sprachmodell ist ein neuronales Netz mit Milliarden von Parametern, das auf großen Textkorpora trainiert wurde, um das nächste Token in einer Sequenz vorherzusagen. Dieses einzelne Ziel, in ausreichendem Umfang, führt zur Fähigkeit, Fragen zu beantworten, Code zu schreiben, zu übersetzen und zusammenzufassen – keines davon wurde direkt dafür trainiert.

Ein großes Sprachmodell wird auf eine Aufgabe trainiert: Gegeben eine Sequenz von Tokens, das nächste vorhersagen. Wiederholt man das über einen riesigen Korpus, kodieren die Parameter des Modells Grammatik, Fakten, Schlussfolgerungsmuster, Codekonventionen und eine große Menge angesammelter menschlicher Schreibstile.

Die meisten modernen LLMs verwenden die Transformer-Architektur, deren Aufmerksamkeitsmechanismus es jeder Position in der Eingabe erlaubt, jede andere zu beeinflussen. Das ermöglicht Langstreckenkohärenz und lässt die Berechnung mit der Sequenzlänge wachsen.

Das Training verläuft in Phasen. Pre-training auf breitem Text erzeugt rohe Fähigkeiten. Post-training – überwachtes Fine-Tuning auf Demonstrationen, dann Reinforcement Learning aus menschlichem oder KI-Feedback – verwandelt einen Textprädiktor in etwas, das Anweisungen befolgt und schädliche Anfragen ablehnt.

Zwei Eigenschaften sind in der Praxis wichtig. Das Modell ist zustandslos: Es erinnert sich zwischen Anfragen an nichts außer dem, was Sie in das Kontextfenster einfügen. Und es ist probabilistisch: Derselbe Prompt kann unterschiedliche Ausgaben liefern, und die Zuversicht im Ton trägt keine Information über die Korrektheit.

Häufige Fragen

Versteht ein LLM, was es schreibt?
Es hat keine Überzeugungen oder Absichten im menschlichen Sinne. Es modelliert die statistische Struktur in der Sprache gut genug, dass seine Ausgabe oft korrekt und nützlich ist – und selbstbewusst falsch, wenn die Struktur in die falsche Richtung weist.
Was macht ein Sprachmodell zu einem „großen“?
Parameteranzahl, Trainingsdatenvolumen und Trainingsrechenleistung, alles weit über früheren Modellen. Es gibt keine formelle Schwelle; der Begriff ist vergleichend und seine Basis verschiebt sich ständig.

Siehe auch

Zuletzt aktualisiert am 22. Aug. 2026