Saltar al contenido
todas las lecciones
Arquitectura3.9Bloqueada

Jefe: repara la attention rota

Has visto a los tokens decidir qué mirar. ¿Podrías arreglar uno que mira la palabra equivocada?

La idea que hay dentro

El haz de attention de cada token apunta a la palabra equivocada. Redirígelo a la palabra de la que de verdad depende, incluso cuando el fallo es mirar al futuro.

Después de esta lección

Puedes detectar un haz de attention mal dirigido, elegir el token al que debería atender según el match Q·K y respetar el causal mask.

Adónde lleva

La attention está cableada y apilada. Ahora el modelo tiene una lista ordenada de palabras siguientes, así que ¿cómo elige una?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

El haz de attention de cada token apunta a la palabra equivocada. Redirígelo a la palabra de la que de verdad depende, incluso cuando el fallo es mirar al futuro.

La pregunta con la que abre

Has visto a los tokens decidir qué mirar. ¿Podrías arreglar uno que mira la palabra equivocada?

El recorrido, en palabras de la propia lección

  • La attention es solo un haz. Reparaste hacia dónde mira cada token.
  • Reparado. El haz saltó a la palabra correcta y la mezcla se re-normalizó sobre ella.
  • La attention de este token apunta a la palabra equivocada. Toca la palabra a la que debería atender.
  • Partes y puntuaciones Q·K de juguete, elegidas para mostrar la reparación. Un head real las calcula con los vectores Query y Key, cuyas rejillas aprendió en el entrenamiento.
  • Esa palabra viene después del token de foco. El causal mask la bloquea. Elige una palabra anterior.
  • Más cerca, pero el Key de esa palabra no coincide con el Query. Relee a quién se refiere el token.
  • La palabra a la que reparaste tiene la coincidencia de Key más alta, por eso gana la mezcla.
  • Redirigiste la attention de cada token a la palabra de la que de verdad depende.
  • Los tres fallos quedaron reparados, pero algunas elecciones necesitaron reintento. Repáralos otra vez para acertar cada haz a la primera.
  • La attention es una decisión de enrutamiento. Un token emite un Query (3.2), cada palabra responde con un Key, el mejor match gana la mezcla softmax de Values (3.3) y un causal mask prohíbe mirar hacia adelante (3.4). Reparar el haz es hacer ese enrutamiento a mano.
  • En cada fallo leíste a quién se refiere el token de foco y luego enviaste su Query a la palabra con el Key que coincide. La fila softmax se re-normalizó sobre tu elección, así que las partes seguían sumando 100%. El fallo del mask mostró la regla dura: una palabra nunca puede atender a una palabra que viene después, por muy bueno que parezca el match. Apila muchas de estas decisiones de enrutamiento en paralelo y tienes multi-head attention (3.5).

La idea clave

Redirigiste la attention a mano: emparejaste un Query con el Key correcto y respetaste el causal mask.

Qué puedes hacer después de esta lección

Puedes detectar un haz de attention mal dirigido, elegir el token al que debería atender según el match Q·K y respetar el causal mask.

Adónde lleva: La attention está cableada y apilada. Ahora el modelo tiene una lista ordenada de palabras siguientes, así que ¿cómo elige una?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.