De dónde salen Query, Key y Value
Una palabra tiene un solo embedding, entonces, ¿de dónde salen tres vectores distintos (Query, Key, Value)?
La idea que hay dentro
Q/K/V son el embedding multiplicado por tres rejillas de pesos aprendidas (W_Q, W_K, W_V); el entrenamiento las ajusta, nadie las escribe.
Después de esta lección
Puedes explicar que Query, Key y Value se crean multiplicando el embedding por tres matrices de pesos que el entrenamiento aprende.
Adónde lleva
Ahora convierte esas coincidencias en un significado actualizado.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Q/K/V son el embedding multiplicado por tres rejillas de pesos aprendidas (W_Q, W_K, W_V); el entrenamiento las ajusta, nadie las escribe.
La pregunta con la que abre
Una palabra tiene un solo embedding, entonces, ¿de dónde salen tres vectores distintos (Query, Key, Value)?
El recorrido, en palabras de la propia lección
- Una palabra tiene un solo embedding. Entonces, ¿de dónde salen tres vectores distintos?
- Multiplica el embedding por una rejilla. Sale la Query.
- Toca Query, Key o Value. El mismo embedding, una rejilla distinta cada vez.
- “bebe” necesita tres versiones de sí misma: una para preguntar, una para responder, una para entregar. Entra un embedding. ¿Cómo se crean las tres?
- Correcto. No se guarda nada por palabra. Un embedding se multiplica por tres rejillas distintas, y cada rejilla lo reforma en una vista diferente. Mira cómo lo hace una rejilla.
- Copiar daría tres vectores idénticos, algo inútil. En vez de eso, cada una de tres rejillas multiplica el embedding en una vista diferente. Mira cómo lo hace una rejilla.
- No se guarda nada por palabra. Las tres vistas se calculan al momento: el embedding por tres rejillas distintas. Mira cómo lo hace una rejilla.
- Cada número de salida es una fila de la rejilla por el embedding, sumado, el mismo producto punto de la 1.3. Entra una rejilla, sale un vector entero.
- Números de juguete, de tres casillas. Un embedding real tiene cientos de números y las rejillas se aprenden, pero el multiplicar y sumar es exactamente esto.
- Una fila convierte todo el embedding en un solo número. Apila una fila por cada casilla de salida y reconstruyes un vector completo, ese conjunto de filas es la rejilla (una matriz de pesos). Vuelves a ver esta misma maniobra en la 3.6 como la capa que va después de la atención.
- Nadie rellena estas rejillas a mano. Empiezan como números al azar, y el entrenamiento (2.4) las empuja una y otra vez hasta que las Queries y las Keys que deberían coincidir se alinean, porque eso hizo más fácil adivinar la palabra siguiente (Acto 2).
- Los ingenieros programan las rejillas para que los verbos busquen su sujeto.
- Nadie escribe esos números. Las rejillas empiezan al azar y el descenso de gradiente las ajusta hasta que coincidencias como verbo con sujeto ayudan a predecir la palabra siguiente. El comportamiento se descubre en el entrenamiento, no se programa.
- Porque un W_Q entrenado hizo la Query de “bebe” y un W_K entrenado hizo la Key de “gato” apuntar casi en la misma dirección, así que su producto punto salió alto. Cambia el entrenamiento y esas rejillas cambian, y también cada puntuación. El 2.7 nunca se fijó a mano.
- La gente dice que hacer fine-tuning de un modelo con tus datos “le enseña tu estilo”. En términos de lo que acabas de ver, ¿qué cambia literalmente dentro del modelo?
- Los números de rejillas como estas. El fine-tuning empuja un poco más las mismas matrices de pesos, así que las Queries, Keys y Values salen algo distintas y el modelo se apoya en otras palabras. No se guarda nada nuevo; se reajustan las rejillas que ya existen.
- Tres trabajos, así que “bebe” necesita tres versiones de sí misma. Un embedding, tres vectores.
- Rejillas entrenadas: “bebe” ahora alcanza a “gato”, su sujeto.
- Rejillas al azar: el alcance es débil y no apunta a nada útil.
- Una imagen del efecto, no un entrenamiento real.
La idea clave
Tres rejillas aprendidas reforman un embedding en tres vistas, y el entrenamiento fijó sus números.
Qué puedes hacer después de esta lección
Puedes explicar que Query, Key y Value se crean multiplicando el embedding por tres matrices de pesos que el entrenamiento aprende.
Adónde lleva: Ahora convierte esas coincidencias en un significado actualizado.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.