Cómo la IA parte el texto en tokens
¿Por qué una IA se traba con '¿cuántas r tiene strawberry?', no está leyendo letras.
La idea que hay dentro
Antes del significado, el texto se divide en tokens, fragmentos comunes de un vocabulario fijo y aprendido.
Después de esta lección
Puedes explicar la tokenization (BPE): texto → tokens → ids, y por qué explica las rarezas de ortografía y el costo en tokens.
Adónde lleva
Los tokens se vuelven vectores, pero ¿y las imágenes y el sonido?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Antes del significado, el texto se divide en tokens, fragmentos comunes de un vocabulario fijo y aprendido.
La pregunta con la que abre
¿Por qué una IA se traba con '¿cuántas r tiene strawberry?', no está leyendo letras.
El recorrido, en palabras de la propia lección
- Corta “strawberry” en los trozos que crees que el modelo guarda.
- Aquí es donde el modelo corta de verdad. Reprodúcelo despacio para verlo.
- Tu turno. Escribe lo que quieras y mira cómo se divide en tokens.
- Los tokens, no las letras, son lo que el modelo cuenta y lo que tú pagas.
- Vocabulario e ids de juguete; los tokenizers reales cortan distinto.
- Una cosa para notar: un espacio al inicio o una mayúscula son parte del token. Así “strawberry”, “ strawberry” y “Strawberry” reciben cada uno un id distinto.
- Prueba açaí: las letras que no son del inglés (acentos, otros alfabetos) suelen partirse en tokens propios, así que el mismo significado puede costar más tokens en otro idioma.
- De ahí salen dos cosas. Al modelo le cuesta contar las letras escondidas dentro de un token: el famoso fallo de “cuenta las r de strawberry”. Los modelos de frontera hoy suelen acertar con esa palabra (el fallo es tan famoso que está en sus datos de entrenamiento), pero la ceguera sigue ahí: prueba con una palabra rara y el conteo vuelve a tambalearse. Y como una petición se cobra por token, más o menos 1 token ≈ ¾ de una palabra en inglés, los tokens, no los caracteres, son la unidad de costo.
- ¿De dónde salen estos trozos? Antes de entrenar cualquier modelo, un algoritmo llamado BPE lee montañas de texto y se queda con los trozos que más aparecen. Las palabras frecuentes terminan como un solo token; las raras se rompen en pedazos. Esa lista fija de trozos es el
- Sí. La mayoría de los tokenizers aprendieron sus trozos de texto casi todo en inglés, así que una palabra común en inglés suele quedar como un token limpio, mientras que la misma idea en español, hindi o chino tiende a partirse en más pedazos. A grandes rasgos (los cortes reales varían según el tokenizer):
- Mismo significado, más tokens. Así que el mismo mensaje puede costar bastante más, y comerse más del presupuesto de contexto, en español que en inglés.
- La brecha se está cerrando: los vocabularios más nuevos (la clase o200k / Llama 3, de 100K-200K trozos) aprendieron de texto mucho más multilingüe, así que las palabras que no son del inglés se parten menos que antes. El inglés sigue tendiendo a ser lo más barato, solo que por un margen menor.
- Una IA cobra por token y tiene un límite de tokens, no de palabras. ¿Por qué las mismas 100 palabras cuestan más en código o en otro idioma que en inglés sencillo?
- La tokenización divide el texto en trozos de palabra, y el código, las palabras raras y muchos idiomas que no son el inglés se parten en más tokens por palabra. Más tokens significa más coste y más presupuesto de contexto usado, por eso la misma idea puede salir más barata o más cara según cómo se tokenice.
- Corta la palabra y mira qué piezas son tokens reales.
- Cada pieza es un token real: el modelo podría guardar esto.
- ¿Un corte por letra? Aquí una sola letra no es un token.
- Las piezas ámbar no son tokens reales: el modelo solo guarda trozos de su vocabulario.
- Cada trozo se vuelve un número, su id del token, que es lo único que el modelo llega a ver.
La idea clave
El verdadero alfabeto del modelo son los tokens, no las letras, lo que explica los errores de ortografía y por qué los tokens son la unidad de costo.
Qué puedes hacer después de esta lección
Puedes explicar la tokenization (BPE): texto → tokens → ids, y por qué explica las rarezas de ortografía y el costo en tokens.
Ponte a prueba: ¿Por qué a un LLM le cuesta contar las r de 'strawberry'?
- Lee tokens (trozos), no letras individuales(correcta)
- Simplemente no sabe deletrear
- Se queda sin memoria
- La palabra no está en sus datos de entrenamiento
El modelo ve la palabra como unos pocos tokens, no como letras sueltas, así que las preguntas de letras como contar las erres le resultan de verdad difíciles.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Tokenización
Adónde lleva: Los tokens se vuelven vectores, pero ¿y las imágenes y el sonido?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.