Ventana de contexto y caché KV
Las conversaciones largas se vuelven lentas / el modelo olvida.
La idea que hay dentro
Longitud de contexto fija; la caché KV reutiliza keys/values pasados para ganar velocidad.
Después de esta lección
Puedes explicar la caché KV y por qué el contexto largo es caro.
Adónde lleva
La atención es ciega al orden: ¿cómo conoce el orden de las palabras?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Longitud de contexto fija; la caché KV reutiliza keys/values pasados para ganar velocidad.
La pregunta con la que abre
Las conversaciones largas se vuelven lentas / el modelo olvida.
El recorrido, en palabras de la propia lección
- Arrastra hacia una palabra más adelante y mira cómo se dispara el número de cuadros encendidos. Ese triángulo que crece es el trabajo.
- Activa la caché. Observa cómo desaparece el trabajo desperdiciado.
- Una pequeña memoria convierte el trabajo de cada palabra nueva de una curva empinada en una línea recta suave, pero sigue subiendo.
- Cada cuadro encendido es una comprobación de atención: la palabra nueva emparejada con una anterior.
- Arrastra hasta la última palabra para sentir cómo se acumula el trabajo.
- ¿Ves qué rápido se llena? La palabra #6 comprueba 6 cuadros; la #1 comprobó solo 1. Llévalo a escala: la palabra #1.000 hace ~100× el trabajo de la #10. Un chat largo se va volviendo más lento.
- Para escribir la palabra siguiente, la atención relee todas las palabras anteriores: el triángulo del enmascaramiento causal (lección 3.4). Así que un chat largo se va volviendo más lento.
- Por paso, el costo es más o menos el número de posición, así que la palabra #1.000 cuesta ~100× la #10. Suma todos los pasos y el trabajo total de la conversación crece ~10.000× (el cuadrado): eso viene a continuación.
- Activada: la Key y el Value de una palabra pasada no cambian, así que se guardan y reutilizan. Solo la palabra nueva añade una fila fresca; el resto se recuerda.
- Desactivada: cada paso reconstruye todo el triángulo desde cero. Desliza hacia palabras más adelante y mira cómo se dispara el área encendida.
- Cada celda empareja la palabra nueva con una anterior usando las claves y los valores de la lección 3.2. Con la caché activada, esas claves y valores se guardan una sola vez y la palabra nueva solo trae una Query fresca para comparar contra todas ellas: esa es su única fila nueva.
- Trabajo de cada palabra NUEVA: una curva empinada sin caché, una línea recta suave con ella; mucho más barato, pero sigue subiendo.
- El KV cache hace que una conversación larga sea prácticamente gratis, como un cache normal que guarda la respuesta.
- Solo evita rehacer el trabajo viejo; el modelo igual vuelve a leer todo el historial en cada palabra, así que el costo sigue subiendo a medida que crece el chat.
- Sin la caché, el trabajo nuevo por paso es releerlo-todo; con ella, solo-la-palabra-nueva. Ese costo creciente, más la memoria que consume la propia caché, es una gran razón por la que los proveedores limitan cuánto contexto ofrecen.
- La razón más profunda: un modelo solo se entrena para manejar hasta cierta longitud máxima, y se vuelve poco fiable más allá de eso: el muro contra el que chocan las próximas lecciones.
- La caché consume mucha memoria de GPU: cada token guarda claves y valores para cada capa. Esa cuenta de memoria es la razón por la que los modelos modernos hacen que grupos de cabezas de atención compartan un mismo juego de claves y valores (GQA, grouped-query attention; MQA cuando todas las cabezas comparten uno), encogiendo la caché varias veces con apenas pérdida de calidad.
- También es la razón por la que los proveedores venden los tokens de entrada "cacheados" con un gran descuento: cuando las claves y los valores de tu prompt ya están en memoria, se ahorran recalcularlos. La lección 6.4 convierte ese descuento en una técnica.
- Una conversación larga con un asistente se vuelve más lenta y más cara cuanto más avanza, y al final olvida el principio. ¿Por qué?
- Cada turno vuelve a leer todo el context window y el KV cache crece con él, así que el costo y la latencia suben con la longitud de la conversación. Y el olvido es cosa de la app: cuando el context window se llena, la app de chat recorta o resume los turnos más viejos para no pasarse del límite (el modelo a secas no olvida con elegancia, simplemente da error al pasarse de su máximo). La solución es gestionar el contexto, recortar, resumir, recuperar, no un modelo más grande.
- Cuadrícula de atención: solo la fila más nueva es trabajo nuevo; las filas anteriores se recuerdan.
- Cuadrícula de atención: todo el triángulo se vuelve a calcular desde cero.
- Trabajo por palabra nueva frente a la longitud de la conversación: una curva empinada sin caché, una línea recta suave que sube con caché.
La idea clave
Por qué el contexto largo es caro, y por qué la caché ayuda.
Qué puedes hacer después de esta lección
Puedes explicar la caché KV y por qué el contexto largo es caro.
Ponte a prueba: ¿Qué hace el KV cache durante una generación larga?
- Reutiliza las keys y values ya calculadas de los tokens anteriores, para no rehacerlas(correcta)
- Guarda la respuesta final para servirla la próxima vez
- Comprime los pesos del modelo
- Guarda en cache las preguntas anteriores del usuario
Sin él, cada token nuevo recalcularía la atención sobre todos los tokens anteriores. El KV cache guarda esas keys y values pasadas y las reutiliza, así la generación sigue rápida a medida que crece el texto. El costo igual sube porque el historial sigue creciendo.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: KV cache
Adónde lleva: La atención es ciega al orden: ¿cómo conoce el orden de las palabras?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.