Token
tokenisation · tokenizer
Kurz gesagt
Ein Token ist die kleinste Texteinheit, die ein Sprachmodell verarbeitet: ein gängiger Wortteil, der von einem Tokenizer erzeugt wird. Im Englischen entspricht ein Token im Durchschnitt etwa vier Zeichen oder etwa 0,75 Wörtern. Kontextgrenzen und API-Preise werden beide in Tokens, nicht in Wörtern, gezählt.
Modelle sehen keine Buchstaben oder Wörter. Text wird zuerst von einem Tokenisierer in Fragmente aufgeteilt, die in seinen Trainingsdaten häufig vorkamen. Häufige Wörter werden zu einzelnen Tokens; seltene Wörter zerfallen in Teile; Leerzeichen und Satzzeichen tragen ihre eigenen.
"unbelievable" → "un" + "believ" + "able"
"the" → "the"
" " → ein Token pro Einrückungsebene im CodeDrei Konsequenzen ergeben sich, und alle drei kosten Geld.
Sprachen sind nicht gleich. Ein Tokenisierer, der hauptsächlich auf englischen Fragmenten trainiert wurde, zerlegt Koreanisch oder Japanisch aggressiver. Das gleiche Dokument kostet in diesen Sprachen mehr Tokens – und damit mehr Geld und mehr vom Kontextfenster – in diesen Sprachen.
Zeichenbasierte Aufgaben sind schwierig. Ein Modell, das gebeten wird, die Buchstaben in einem Wort zu zählen, arbeitet mit Fragmenten, nicht mit Buchstaben. Deshalb scheitern Rechtschreibrätsel auf eine Weise, die neben den anderen Fähigkeiten des Modells absurd wirkt.
Ausgabelänge ist ein Kostenhebel. Da Ausgabetokens die teure Seite sind, ist "Antworte in drei Stichpunkten" ebenso eine Budgetentscheidung wie eine Formatierungsentscheidung.
Häufige Fragen
- Wie viele Token sind 1.000 Wörter?
- Ungefähr 1.300 Token auf Englisch. Koreanischer, japanischer und chinesischer Text erzeugt typischerweise erheblich mehr Token bei gleicher sichtbarer Länge, da diese Schriftsysteme unter gängigen Tokenizern stärker fragmentiert werden.
- Warum werde ich separat für Ein- und Ausgabe abgerechnet?
- Die Eingabe kann parallel über die Sequenz verarbeitet werden; die Ausgabe muss Token für Token generiert werden, wobei jeder Token einen vollständigen Durchlauf durch das Modell erfordert. Die Ausgabe ist daher pro Token um ein Vielfaches teurer.