Por qué el contexto lo cambia todo
Para completar 'El gato bebe ___', un token debe mirar atrás a 'gato'. Los bigramas solo ven la palabra anterior.
La idea que hay dentro
Los tokens deben mirar a otros tokens.
Después de esta lección
Puedes explicar por qué un modelo debe dejar que las palabras miren a otras palabras (atención).
Adónde lleva
¿Cómo decide un token qué mirar?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Los tokens deben mirar a otros tokens.
La pregunta con la que abre
Para completar 'El gato bebe ___', un token debe mirar atrás a 'gato'. Los bigramas solo ven la palabra anterior.
El recorrido, en palabras de la propia lección
- Toca la palabra que crees que llena el hueco. Un bigrama solo ve “bebe”.
- ¿Qué palabra anterior desbloquearía la respuesta correcta?
- Mira cómo el vecino del hueco se estira hacia atrás hasta esa palabra.
- Ese estirarse hacia atrás es toda la idea de la atención.
- Correcto, solo “gato” nos dice quién bebe, y los gatos beben leche. Esa es la pista que un bigrama nunca ve.
- Un bigrama recuerda una palabra. La atención permite que cada palabra se estire hacia atrás por toda la frase y pondere lo que encuentra, “bebe” encontró “gato” dos palabras atrás. Ese alcance, ejecutado en paralelo sobre pasajes largos, es lo que hizo posibles los modelos de lenguaje modernos.
- Nadie le dice al modelo que un verbo deba mirar atrás a su sujeto. Aprende qué palabras traer mientras entrena para predecir la palabra siguiente (Acto 2), el mismo juego que jugaste ahí.
- Pegas un hilo largo de correos y le pides a un modelo que lo resuma. Dice correctamente que “ella” en el tercer mensaje es la gerente nombrada justo al principio. ¿Cómo llega tan atrás?
- Eso es attention: cuando procesa “ella”, el modelo mira hacia atrás sobre cada palabra anterior y pondera con más fuerza a la gerente, trayendo ese significado. El mismo alcance que aquí unió “bebe” con “gato” es lo que le permite seguir quién y qué a lo largo de páginas de contexto.
- Tú sabías que un gato estaba bebiendo. El bigrama nunca ve “gato”, así que no puede.
- Una suposición justa: con solo “bebe” como pista, cualquier palabra aquí encaja.
La idea clave
Motiva la atención.
Qué puedes hacer después de esta lección
Puedes explicar por qué un modelo debe dejar que las palabras miren a otras palabras (atención).
Ponte a prueba: ¿Por qué un token debe poder mirar a los otros tokens?
- El significado de una palabra depende de las palabras que la rodean(correcta)
- Para contar cuántos tokens hay
- Para ordenar los tokens alfabéticamente
- Para ahorrar memoria
La misma palabra significa cosas distintas en distintas frases ('bank' junto a 'river' vs 'money'), así que cada token tiene que leer a sus vecinos. Eso es lo que hace la atención.
Adónde lleva: ¿Cómo decide un token qué mirar?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.