Saltar al contenido

Widget interactivo · gratis · insertable

Query, Key, Value: haz una búsqueda de attention a mano

La palabra bebe levanta su Query. Toca la palabra cuya Key crees que encaja mejor, y mira la puntuación y el flujo del Value.

1“bebe” levanta su Query. Toca la palabra cuya pestaña de carpeta (su Key) creas que coincide mejor.tu turno
bebeQuery: ¿quién es mi sujeto?
Toca la pestaña de carpeta que creas que coincide.tu turno
La puntuación más alta gana la mayor parte.
¿De dónde salen Query, Key y Value?

Cada palabra empieza como su único embedding (de la 1.2). El modelo multiplica ese embedding por tres rejillas de números distintas para crear tres vistas, una Query, una Key y un Value. Cada vista es un vector, así que la puntuación es simplemente su producto punto, el mismo de la Lección 1.3.

Esas rejillas se aprenden en el entrenamiento, nadie las escribe a mano. La siguiente lección construye Query, Key y Value paso a paso y muestra exactamente de dónde salen los números.

Paso 1 / 3

Qué vas a hacer

  1. 1Una palabra hace una pregunta. Toca la palabra anterior cuya Key crees que la responde.
  2. 2Mira la puntuación del cruce: un producto punto entre la Query y cada Key, la misma operación que compara embeddings.
  3. 3Mira cómo el Value de la palabra ganadora fluye hacia la palabra que pregunta, que ahora sabe cuál es su sujeto.

Qué muestra

Attention es una búsqueda, y este widget te deja hacer una a mano. Cada palabra arranca como un solo embedding. El modelo multiplica ese embedding por tres cuadrículas de números aprendidas para obtener tres vistas de la misma palabra: una Query, que hace una pregunta, una Key, que anuncia lo que la palabra contiene, y un Value, que es el contenido que entrega cuando la eligen.

Cuando bebe levanta su Query, cada palabra anterior ofrece su Key. La puntuación de cada par es un producto punto, multiplicas las casillas que coinciden y las sumas, exactamente el truco de similitud de las lecciones de embeddings. La puntuación más alta gana la porción más grande, y el Value de esa palabra fluye hacia bebe. En la frase del escenario gana gato, así que bebe ahora carga el dato de que un gato es quien bebe.

Los números de las barras y los números de la vista expandida son los mismos números. No pasa nada oculto entre ellos. Ese es el punto de hacerlo a mano: toda la attention en una posición son unas pocas multiplicaciones y una suma.

Por qué importa

Esta es la maquinaria que desambigua palabras por contexto. En la frase dejé el banco para pescar junto al río, banco manda una Query, río responde con una Key que puntúa alto, y el Value de río empuja a banco hacia el sentido de la orilla. La multi-head attention corre muchas de estas búsquedas en paralelo, y un transformer apila decenas de capas de ellas. Una vez que la búsqueda individual está clara, el resto de la arquitectura es repetición.

La idea clave

Attention reutiliza el producto punto que ya conoces. Una Query contra cada Key da puntuaciones, y la más alta gana la porción más grande de Value.

Nota honesta: Los números de Query y Key aquí son valores de juguete legibles. Los reales se aprenden en el entrenamiento y tienen cientos de dimensiones. La lección que sigue a esta muestra exactamente de dónde salen esas cuadrículas de números.

Este widget es una etapa de una lección completa, con la historia alrededor.

Gratis, sin código, sin registro.

Inserta este widget

Pega esto en cualquier página HTML, plataforma de cursos, wiki o herramienta de diapositivas que acepte un iframe. Funciona sin cuenta, no pone cookies propias y enlaza de vuelta aquí.

La atribución ya viene incluida. Si escribes sobre él, un enlace a esta página es todo lo que pedimos.

Preguntas frecuentes

¿Qué diferencia hay entre una Key y un Value?
La Key es lo que una palabra anuncia para que las demás decidan si le prestan atención. El Value es lo que la palabra entrega de verdad cuando la eligen. La puntuación usa Keys; la mezcla que actualiza a la palabra que pregunta usa Values. Ambos salen del mismo embedding a través de matrices aprendidas distintas.
¿El producto punto es de verdad todo lo que hay en la puntuación?
Para una head en una posición, sí: multiplicas las casillas que coinciden y sumas. Los modelos reales escalan esa suma por la raíz de la dimensión y aplican softmax sobre todas las puntuaciones para que se conviertan en porciones que suman uno. El widget muestra las puntuaciones crudas para que puedas revisar la aritmética tú mismo.
¿Puedo poner este widget en una clase o en la página de un curso?
Sí. El fragmento para insertar de esta página mete el escenario en cualquier página HTML o herramienta de diapositivas que acepte un iframe. Funciona sin cuenta y enlaza de vuelta a la lección completa.

Explicadores relacionados

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.