Explicador en lenguaje claro
Tokens y tokenización, explicados
¿Qué es un token, y por qué la IA cuenta tokens en vez de palabras?
Un token es un trozo de texto, a menudo un fragmento de palabra y no una palabra entera. Antes de leer tu texto, el modelo lo parte en tokens y asigna un número a cada uno. Los modelos cobran y presupuestan en tokens, no en palabras, porque los tokens son la unidad real que procesan. La misma idea puede costar más o menos según cómo se parta: las palabras comunes en inglés son un token, mientras que el código, las palabras raras y muchos idiomas no ingleses se rompen en más tokens por palabra.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Convertir palabras en números →Gratis, sin código, sin registro.
Y después ve más a fondo: Cómo la IA parte el texto en tokens Bloqueada
Lo que la gente entiende mal
- Un token es una palabra. Muchas veces es un fragmento, así que 100 palabras rara vez son 100 tokens.
- El número de tokens sigue al de caracteres. Sigue a cómo se parte el texto, por eso el código y algunos idiomas cuestan más.
- La tokenización es un detalle que puedes ignorar. Define el costo, los límites de context y hasta algunos errores raros del modelo.
Dónde lo ves en productos reales
- El precio de las APIs es por token, de entrada y de salida.
- Los límites de context se miden en tokens, así que la tokenización decide cuánto cabe.
- Las apps multilingües pueden salir más caras porque algunos idiomas se tokenizan en más piezas.
Preguntas frecuentes
- ¿Por qué a los modelos les cuesta contar las letras de una palabra?
- Nunca ven letras. Una palabra como strawberry puede llegar como dos o tres tokens, así que preguntarle cuántas erres tiene es como pedirle a alguien que deletree una palabra que solo escuchó. Ahora aciertan más porque han visto la pregunta, no porque hayan aprendido a deletrear.
- ¿Cuántas palabras son 1.000 tokens?
- Unas 750 palabras de inglés corriente. La proporción empeora con código, nombres raros y con idiomas para los que el tokenizer no fue ajustado, donde una palabra puede costar varios tokens. El mismo párrafo en español suele costar más tokens que en inglés.
- ¿Todos los modelos usan los mismos tokens?
- No. Cada familia de modelos trae su propio vocabulario, así que una misma frase tiene distinto número de tokens en distintos modelos. Como los precios se cotizan por token, comparar dos proveedores solo por el precio por token engaña hasta que comparas cómo parte cada uno tu texto real.
Explicadores relacionados
Más en Fundamentos
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.