Mixture of Experts (MoE)
MoE · sparse model
Kurz gesagt
Mixture of Experts teilt Teile eines Netzwerks in viele parallele Teilnetzwerke auf und verwendet einen Router, um jedes Token nur durch einige davon zu leiten. Die Gesamtzahl der Parameter bleibt groß, während die Berechnung pro Token klein bleibt, weshalb mehrere sehr große Modelle günstiger zu bedienen sind, als ihre Größe vermuten lässt.
In einem dichten Modell nimmt jeder Parameter an der Verarbeitung jedes Tokens teil. In einem Mixture-of-Experts-Modell werden bestimmte Schichten durch eine Reihe paralleler Experten ersetzt, und ein kleines Router-Netzwerk wählt aus, durch welche zwei oder drei davon jedes Token läuft.
Die Ökonomie ist der entscheidende Punkt. Ein Modell kann Hunderte von Milliarden von Gesamtparametern enthalten, während es nur Zehnmilliarden pro Token aktiviert. Die Kapazität skaliert mit der Gesamtzahl; die Rechenkosten skalieren mit dem aktiven Teil.
Der Kompromiss ist der Speicher. Alle Experten müssen resident und erreichbar sein, daher folgt die Hardwareanforderung den Gesamtparametern, obwohl die Arithmetik den aktiven folgt. Das macht MoE-Modelle für Betreiber, die im großen Maßstab arbeiten, attraktiv und für jemanden, der versucht, sie auf einen einzelnen Beschleuniger zu passen, umständlich.
Das Training bringt seine eigenen Schwierigkeiten mit sich: Wenn der Router die meisten Tokens an eine Handvoll bevorzugter Experten sendet, lernen die restlichen nie etwas Nützliches. Es gibt Ziele zur Lastverteilung, um dies zu verhindern und ein Abstimmungsproblem hinzuzufügen, das dichte Modelle nicht haben.
Häufige Fragen
- Warum geben MoE-Modelle zwei Parameteranzahlen an?
- Gesamtparameter beschreiben das gesamte Modell; aktive Parameter beschreiben, wie viele pro Token verwendet werden. Die Rechenkosten verfolgen die aktive Anzahl, während der Speicherbedarf die Gesamtzahl verfolgt.
- Sind MoE-Modelle schlechter als dichte Modelle?
- Nicht inhärent. Sie bieten mehr Kapazität pro Recheneinheit, allerdings auf Kosten höherer Speicheranforderungen und komplexerer Trainings, da der Router lernen muss, die Arbeit gleichmäßig zu verteilen.