Cómo la atención mezcla el significado
Q·K → puntuaciones → softmax → suma ponderada de los Values.
drinks mira con más fuerza a cat · 61%
bebe reparte el 100% de su atención entre las palabras (estas suman 100%):
Cada porción escala el Value de esa palabra, el significado que lleva (de 3.2); súmalas y obtienes bebe su nuevo significado.
La barra de cada fila muestra dónde mira esa palabra. Arrastra Nitidez; las porciones siempre suman 100%.
Llegaste al final de la muestra gratis. La siguiente lección necesita tu pase:
Durante el entrenamiento, el modelo podría hacer trampa viendo el futuro…
3.4 Por qué no puede mirar hacia adelanteSe apoya en3.2Query, Key, Value
Preguntas frecuentes
¿De qué trata "Cómo la atención mezcla el significado"?
¿Qué pregunta responde esta lección?
¿Qué sabré hacer después de esta lección?
¿Qué viene después?
Qué muestra esta lección
Q·K → puntuaciones → softmax → suma ponderada de los Values.
La pregunta con la que abre
¿Cómo se convierten las puntuaciones en bruto en una mezcla de significados?
El recorrido, en palabras de la propia lección
- Arrastra Nitidez para afinar o difuminar la mezcla y mira cómo se redistribuyen las porciones.
- Nueva tarea para la misma oración: las puntuaciones en bruto se vuelven una mezcla que suma 100%.
- Te toca adivinar antes de que la cuadrícula lo revele.
- Haz clic en la fila de cualquier palabra. Arrastra el control para afinar o difuminar su foco.
- Misma oración «el gato bebe leche», nueva tarea: ahora cada palabra reconstruye su significado a partir de las palabras que la rodean. El softmax convierte las puntuaciones en bruto en una mezcla que siempre suma 100%.
- Una palabra que conoce su contexto completo es justo lo que le permite al modelo predecir lo que viene después. (Próxima lección: por qué a una palabra no se le permite espiar las palabras que vienen después de ella.)
- Después de que softmax las mezcla, ¿en qué palabra se apoya más?
- Baja = foco láser en una sola palabra. Alta = la atención se reparte de forma pareja.
- Cada porción escala el Value de esa palabra, el significado que lleva (de 3.2); súmalas y obtienes
- La barra de cada fila muestra dónde mira esa palabra. Arrastra Nitidez; las porciones siempre suman 100%.
- Cada palabra reconstruye su significado a partir de las palabras a las que atiende.
- La atención solo elige la mejor palabra e ignora el resto.
- Mezcla. El softmax reparte el 100% entre todas las palabras que puede ver, así que la ganadora pesa más pero las demás también suman un poco, y esa mezcla es el nuevo significado de la palabra.
- Combina este paso de atención con las otras piezas que conocerás a continuación, una pequeña red por palabra, más un par de trucos estabilizadores, para formar un bloque transformer, y repite ese bloque muchas veces para obtener el motor detrás de ChatGPT, Claude y los demás.
- Pregúntale a un modelo: el trofeo no cabía en la maleta porque era demasiado grande, ¿qué era demasiado grande? Responde el trofeo. ¿Qué le permitió resolverlo?
- La attention: al procesar it, el modelo pondera cada palabra anterior y se apoya sobre todo en trophy, mezclando ese significado. Resolver pronombres, referencias a distancia y palabras que dependen del contexto es la attention decidiendo qué mirar.
- Estas puntuaciones del emparejamiento Q·K de 3.2 las fijó el entrenamiento: de cualquier tamaño, solo un montón de votos.
- El softmax vierte esos votos en una sola barra que siempre suma 100%…
La idea clave
Observa cómo el significado de una palabra se actualiza según su contexto.
Qué puedes hacer después de esta lección
Puedes explicar la atención de principio a fin: Q·K → softmax → suma ponderada de los Values.
Ponte a prueba: En una frase, ¿qué es la atención?
- Cada palabra mira otras palabras para actualizar su significado(correcta)
- Un vocabulario más grande
- Una GPU más rápida
- Una forma de comprimir el contexto
La atención deja que cada palabra tome significado de las otras de las que depende, así 'bank' junto a 'river' significa algo distinto que junto a 'money'.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: AttentionSoftmax
Adónde lleva: Durante el entrenamiento, el modelo podría hacer trampa viendo el futuro…
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.