Token
tokenisation · tokenizer
En corto
Un token es la unidad más pequeña de texto que procesa un modelo de lenguaje: un fragmento de palabra común producido por un tokenizador. En inglés, un token promedia aproximadamente cuatro caracteres, o alrededor de 0.75 palabras. Los límites de contexto y los precios de la API se cuentan en tokens, no en palabras.
Los modelos no ven letras ni palabras. El texto se divide primero mediante un tokenizador en fragmentos que aparecieron con frecuencia en sus datos de entrenamiento. Las palabras comunes se convierten en tokens individuales; las palabras raras se dividen en partes; los espacios en blanco y la puntuación tienen los suyos propios.
"unbelievable" → "un" + "believ" + "able"
"the" → "the"
" " → un token por nivel de indentación en el códigoSe derivan tres consecuencias, y las tres cuestan dinero.
Los idiomas no son iguales. Un tokenizador entrenado principalmente en fragmentos de inglés tokeniza el coreano o el japonés de forma más agresiva. El mismo documento cuesta más en tokens —y, por lo tanto, más en moneda y más de la ventana de contexto— en esos idiomas.
Las tareas a nivel de carácter son difíciles. Un modelo al que se le pide contar letras en una palabra está trabajando con fragmentos, no con letras. Esta es la razón por la que los acertijos de ortografía fallan de maneras que parecen absurdas en comparación con otras habilidades del modelo.
La longitud de la salida es una palanca de costos. Dado que los tokens de salida son el lado caro, "responder en tres puntos" es una decisión presupuestaria tanto como una de formato.
Preguntas frecuentes
- ¿Cuántos tokens son 1.000 palabras?
- Aproximadamente 1.300 tokens en inglés. El texto en coreano, japonés y chino suele producir sustancialmente más tokens para la misma longitud visible, porque esos guiones se fragmentan más bajo los tokenizadores comunes.
- ¿Por qué se me factura la entrada y la salida por separado?
- La entrada se puede procesar en paralelo a lo largo de la secuencia; la salida debe generarse un token a la vez, cada uno requiriendo un pase completo por el modelo. Por lo tanto, la salida cuesta varias veces más por token.