Atención multicabeza
Un solo patrón de atención no puede seguir a la vez el sujeto de una palabra y sus vecinas.
La idea que hay dentro
Varias cabezas atienden a distintas relaciones en paralelo.
Después de esta lección
Puedes explicar la atención multicabeza: cabezas en paralelo, cada una con un patrón distinto.
Adónde lleva
¿Qué convierte un vector mezclado en la entrada de la siguiente capa?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Varias cabezas atienden a distintas relaciones en paralelo.
La pregunta con la que abre
Un solo patrón de atención no puede seguir a la vez el sujeto de una palabra y sus vecinas.
El recorrido, en palabras de la propia lección
- “bebe” debe captar su sujeto Y sus vecinos a la vez. Toca un cabezal para probarlo: ¿puede un solo mapa con ambos?
- Aquí está la solución: varios cabezales, cada uno vigilando un tipo de relación.
- Tu turno. Cambia de cabezal: cada uno ilumina un patrón distinto, sobre la misma frase.
- Todos los cabezales corren a la vez: cada uno emite un vector. Concaténalos y luego una sola proyección los mezcla en la salida de la capa.
- Ningún mapa por sí solo hace ambas cosas: gramática capta el sujeto pero pierde a los vecinos; vecinos hace lo contrario. La solución: correr varios patrones en paralelo.
- Los números de estos vectores son inventados; los pasos de la fusión (suma ponderada, concatenar, proyectar) son el mecanismo real.
- Concatenados, puestos en fila, no promediados, y luego una sola proyección (W_O) mezcla los cabezales en un único vector más rico. Nadie le asigna su trabajo a un cabezal: cada cabezal empieza al azar, y el entrenamiento empuja a cada uno hacia un patrón distinto.
- Las cabezas se promedian juntas en un único mapa de atención mezclado.
- Se ponen una tras otra, no se promedian. Cada cabeza conserva su propia salida, y luego una proyección las mezcla en un único vector más rico.
- W_O es una matriz de pesos aprendida, del mismo tipo que construyó Query, Key y Value a partir de un embedding. Nadie fija sus números a mano; lo hace el entrenamiento, junto con las rejillas dentro de cada cabezal.
- Cuando los investigadores miran dentro de un modelo, encuentran un cabezal que sigue la concordancia sujeto-verbo y otro distinto que vincula las citas con quién las dijo. ¿Por qué se reparten estos trabajos en cabezales separados?
- Eso es la atención multi-cabezal: cada cabezal aprende su propio patrón de relación, y todos corren en paralelo sobre la misma frase. Ningún cabezal solo puede captar gramática, hablante y tema a la vez, así que el modelo reparte el trabajo entre docenas de cabezales.
- Sigue alternando entre los mapas: cada uno capta una relación, pero nunca ambas.
- Cada “cabezal” es su propio patrón de atención, todos sobre la misma frase.
- Cada cabezal termina el paso de atención, una suma ponderada de sus propios Values, y emite un vector de salida:
La idea clave
Una cabeza para la gramática, otra para las palabras cercanas.
Qué puedes hacer después de esta lección
Puedes explicar la atención multicabeza: cabezas en paralelo, cada una con un patrón distinto.
Ponte a prueba: ¿Por qué los transformers usan varias cabezas de atención en vez de una?
- Cada cabeza puede seguir un tipo de relación distinto en paralelo(correcta)
- Para agrandar el modelo sin motivo real
- Se usa una cabeza por palabra de la frase
- Para traducir entre idiomas
Un solo patrón de atención solo puede seguir un tipo de vínculo. Varias cabezas corren en paralelo, así una puede seguir el sujeto, otra una referencia lejana, y así.
Adónde lleva: ¿Qué convierte un vector mezclado en la entrada de la siguiente capa?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.