Skip to content
DigitalNeuron
Sicherheit & Ethik

Ausrichtung

RLHF · post-training · safety tuning

Kurz gesagt

Alignment ist der Prozess, das Verhalten eines trainierten Modells so zu gestalten, dass es Anweisungen befolgt, nach bestem Wissen die Wahrheit sagt und schädliche Anfragen ablehnt. Es geschieht nach dem Vortraining, hauptsächlich durch überwachtes Fine-Tuning anhand von Demonstrationen und Reinforcement Learning aus menschlichem oder KI-Feedback.

Ein Modell, das direkt aus dem Vortraining kommt, sagt Text voraus. Es folgt keinen Anweisungen, zieht Plausibilität nicht der Wahrheit vor und hat keine Vorstellung davon, was es ablehnen sollte. Alignment ist das, was daraus einen Assistenten macht.

Die Standard-Pipeline hat zwei Stufen. Supervised Fine-Tuning trainiert mit kuratierten Beispielen guter Antworten. Preference Optimisation – RLHF oder Methoden wie DPO, die das separate Belohnungsmodell überspringen – trainiert das Modell, Antworten zu bevorzugen, die Menschen höher bewertet haben.

Konstitutionelle Ansätze ersetzen einen Großteil des menschlichen Labelings durch eine schriftliche Reihe von Prinzipien: Das Modell kritisiert und überarbeitet seine eigenen Ausgaben anhand festgelegter Regeln und erzeugt Präferenzdaten in großem Maßstab.

Zwei Grenzen sind es wert, klar benannt zu werden. Alignment ist verhaltensbezogen, nicht epistemisch – es bringt ein Modell dazu, hilfreich zu agieren und angemessen abzulehnen; es gibt ihm keinen Mechanismus, um zu wissen, ob eine Aussage wahr ist, weshalb Halluzination fortbesteht. Und es ist umstritten: Wessen Werte, welche Ablehnungen und wie viel Vorsicht, bevor ein Modell nutzlos wird, sind Fragen ohne technische Antwort.

Das Forschungsprogramm reicht weit über das Produktverhalten hinaus – Interpretierbarkeit, Bewertung gefährlicher Fähigkeiten, skalierbare Aufsicht –, aber im kommerziellen Gebrauch bedeutet "aligned" normalerweise die engere, oben beschriebene Sache.

Häufige Fragen

Was ist RLHF?
Reinforcement Learning from Human Feedback: Menschen bewerten alternative Modellantworten, ein Belohnungsmodell wird auf diesen Bewertungen trainiert und das Modell wird dagegen optimiert. Varianten ersetzen einige menschliche Bewertungen durch KI-generierte.
Macht Ausrichtung ein Modell weniger leistungsfähig?
Es kann an den Rändern — die üblichen Beschwerden über die übervorsichtige Ablehnung harmloser Anfragen. Das Abwägen von Hilfsbereitschaft und Vorsicht ist ein explizites Abstimmungs‑Trade‑off, kein Zufall.

Siehe auch

Zuletzt aktualisiert am 22. Aug. 2026