Inferenz
serving · generation
Kurz gesagt
Inferenz ist der Vorgang, bei dem ein trainiertes Modell mit neuen Eingaben ausgeführt wird, um Ausgaben zu erzeugen, im Gegensatz zum Training, das das Modell überhaupt erst erzeugt. Training ist eine einmalige Kostenbelastung; Inferenz wiederholt sich für jede Anfrage, und im Laufe des Lebens eines weit verbreiteten Modells dominiert sie sowohl die Ausgaben als auch den Energieverbrauch.
Inferenz gliedert sich in zwei Phasen mit unterschiedlichen Leistungseigenschaften.
Prefill verarbeitet die gesamte Eingabe auf einmal. Es lässt sich gut parallelisieren und ist rechenintensiv, skaliert also mit der Eingabelänge und bestimmt, wie lange der Benutzer auf das erste Token wartet.
Decode generiert die Ausgabe Token für Token, wobei jeder Schritt einen vollständigen Durchlauf über die Gewichte des Modells erfordert. Es ist speicherbandbreitenlimitiert und bestimmt die vom Benutzer wahrgenommene Wort-pro-Sekunde-Rate.
Die meisten Serving-Optimierungen zielen auf eine dieser Phasen ab. Continuous batching hält Beschleuniger beschäftigt, indem es Anfragen zusammenführt, die zu unterschiedlichen Zeiten eintreffen. KV-Caching speichert den Zwischenzustand der Aufmerksamkeit, sodass frühere Token nicht bei jedem Schritt neu berechnet werden. Speculative decoding lässt ein kleines Modell mehrere Token entwerfen, die das große Modell in einem Durchgang überprüft. [Quantisierung](/en/glossary/quantization) verkleinert die Gewichte, sodass mehr in den schnellen Speicher passt. [Mixture-of-experts](/en/glossary/mixture-of-experts) leitet jedes Token nur durch einen Teil des Netzwerks.
Die wirtschaftliche Konsequenz ist, dass die Inferenz-Effizienz und nicht die Modellgröße bestimmt, ob ein KI-Produkt eine tragfähige Marge hat – und dieselben Optimierungen, die Kosten senken, reduzieren auch den Energieverbrauch.
Häufige Fragen
- Warum ist das erste Token langsamer als die restlichen?
- Das Modell muss die gesamte Eingabe verarbeiten, bevor es etwas generiert – die Präfüllphase. Danach werden die Token einzeln in der Dekodierungsphase erzeugt, die eher durch die Speicherbandbreite als durch reine Rechenleistung begrenzt ist.
- Kostest die Inferenz insgesamt mehr als das Training?
- Für jedes Modell im realen Produktionseinsatz, ja. Das Training ist endlich; die Inferenz wiederholt sich unendlich oft, und die kumulierten Inferenzkosten übersteigen die Trainingskosten gut innerhalb der Lebensdauer eines Modells.