Feinabstimmung
SFT · supervised fine-tuning · LoRA
Kurz gesagt
Fine-Tuning setzt das Training eines vortrainierten Modells auf einem kleineren, aufgaben-spezifischen Datensatz fort und passt dessen Gewichte an, damit es zuverlässig ein bestimmtes Format, einen bestimmten Ton oder eine spezifische Fähigkeit erzeugt. Es ist eine schlechte Methode, um Fakten zu vermitteln, da sich diese ändern und besser durch Abruf zum Zeitpunkt der Anfrage bereitgestellt werden.
Fine-Tuning beginnt mit einem Modell, das die Sprache bereits beherrscht, und passt dessen Gewichte in Richtung eines spezifischen Verhaltens an. Die richtige Frage, die man sich vor dem Start stellen sollte, lautet: Ist mein Problem Wissen oder Verhalten?
Wenn das Modell Ihren Produktkatalog nicht kennt, ist Fine-Tuning das falsche Werkzeug – der Katalog ändert sich wöchentlich, das erneute Training nicht. Nutzen Sie Retrieval.
Wenn das Modell viel weiß, aber nicht konsistent Ihr JSON-Schema ausgibt, Ihren Stil übernimmt oder Ihre interne Klassifikationstaxonomie anwendet, leistet Fine-Tuning dies gut und kostengünstig.
Full Fine-Tuning aktualisiert jeden Parameter: teuer, und es erzeugt eine vollständige Kopie des Modells zum Hosten. LoRA und ähnliche parameter-effiziente Methoden trainieren einen kleinen Adapter neben dem eingefrorenen Basismodell, was dramatisch günstiger ist und für die meisten Zwecke ausreicht.
Drei praktische Vorsichtsmaßnahmen. Fine-getunte Modelle können allgemeine Fähigkeiten in Bereichen verlieren, die der Trainingsdatensatz vernachlässigt – ein Phänomen, das üblicherweise als katastrophales Vergessen bezeichnet wird. Das zugrunde liegende Basismodell wird irgendwann veraltet sein, und Ihr Adapter geht damit unter, also planen Sie die Wiederholung der Arbeit ein. Und der Aufwand ist häufig unnötig: Teams führen routinemäßig Fine-Tuning durch, um Probleme zu lösen, die mit einem klareren Prompt und einigen Beispielen im Kontext an einem Nachmittag gelöst worden wären. Probieren Sie das zuerst.
Häufige Fragen
- Wie viele Beispiele benötige ich zum Feinabstimmen?
- Für Format und Ton sind oft einige hundert hochwertige Beispiele besser als zehntausende verrauschte. Konsistenz im Trainingsdatensatz ist wichtiger als Umfang.
- Was ist LoRA?
- Low-Rank Adaptation trainiert eine kleine Menge zusätzlicher Parameter, anstatt das gesamte Modell zu aktualisieren. Es ist weitaus kostengünstiger, erzeugt eine kleine Adapterdatei anstelle einer vollständigen Modellkopie und ist für die meisten Anpassungsarbeiten ausreichend.