Saltar al contenido

Explicador en lenguaje claro

La atención, explicada

¿Qué hace el mecanismo de atención en un transformer?

La atención permite que cada palabra mire a las demás palabras de la frase y decida cuáles importan para ella en ese momento. En 'el trofeo no cabía en la maleta porque era demasiado grande', la atención es lo que le dice al modelo que 'era' se refiere al trofeo. Cada posición reúne una mezcla ponderada de las otras, apoyándose más en las que encajan. Así maneja el modelo los pronombres, las referencias a distancia y la forma en que el significado de una palabra cambia con su contexto.

Revisado por última vez el

No te quedes en leerlo. Opera tú mismo el mecanismo en una lección interactiva corta.

Míralo funcionar: Cómo la atención mezcla el significado

Gratis, sin código, sin registro.

Lo que la gente entiende mal

  • La atención lee estrictamente de izquierda a derecha. Puede ponderar todas las palabras anteriores a la vez, no solo la previa.
  • Es coincidencia de palabras clave. Es una mezcla ponderada y aprendida de significado, no una búsqueda de palabras exactas.
  • Más cabezas de atención siempre es mejor. Las cabezas se especializan, y pasado un punto el beneficio decae.

Dónde lo ves en productos reales

  • Todo modelo moderno de chat y de código se construye sobre capas de atención apiladas.
  • Entender documentos largos depende de que la atención conecte partes lejanas.
  • La calidad con pronombres, referencias de código y citas viene de que la atención funcione bien.

Preguntas frecuentes

¿Qué le hace exactamente la attention a una palabra?
Para cada palabra puntúa qué tan relevante es cada una de las demás, y luego las mezcla en esa proporción. El resultado reemplaza la representación de esa palabra por una versión teñida por su contexto, y por eso bank significa cosas distintas en una frase de río y en una de dinero.
¿Qué es la multi-head attention?
El mismo mecanismo corrido varias veces en paralelo con pesos aprendidos distintos, y después combinado. Cada head puede especializarse, una siguiendo el sujeto gramatical y otra una referencia hecha veinte palabras atrás, así una sola capa sigue varios tipos de relación a la vez.
¿Por qué la attention es cara con entradas largas?
Cada token se compara con todos los demás, así que ese trabajo crece con el cuadrado del largo de la secuencia. Duplicar la entrada lo cuadruplica más o menos. Por eso el contexto largo es un problema de ingeniería difícil y no un ajuste que alguien olvidó subir.

Explicadores relacionados

Más en Dentro del transformer

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.