Saltar al contenido

Widget interactivo · gratis · insertable

KV cache: mira cómo un chat largo se vuelve lento, y arréglalo

Arrastra hasta una palabra posterior y mira cómo se infla el trabajo de attention. Enciende la cache y mira desaparecer el trabajo desperdiciado.

1Arrastra hacia una palabra más adelante y mira cómo se dispara el número de cuadros encendidos. Ese triángulo que crece es el trabajo.tu turno

Escribiendo la palabra #1

recalculado en este paso

Cada cuadro encendido es una comprobación de atención: la palabra nueva emparejada con una anterior.

Paso 1 / 3

Qué vas a hacer

  1. 1Arrastra el control hasta una palabra posterior. Cada casilla encendida es una comprobación de attention, y el triángulo se infla mientras avanzas.
  2. 2Enciende la cache. Las palabras pasadas conservan su Key y su Value, así que solo la fila más nueva es trabajo fresco.
  3. 3Lee el gráfico de costo: una curva empinada por palabra sin cache, una línea recta suave con ella. Las dos siguen subiendo.

Qué muestra

Para escribir la siguiente palabra, un modelo de lenguaje corre attention sobre todas las palabras anteriores. Ese es el triángulo encendido del escenario. La palabra seis revisa seis casillas, la palabra uno revisó una. Escálalo y la palabra mil hace unas cien veces el trabajo de la palabra diez, y la conversación entera ha hecho un trabajo que crece con el cuadrado de su largo. Por eso un chat largo se vuelve más lento cuanto más avanza.

La KV cache es el arreglo. La Key y el Value de una palabra pasada nunca cambian, así que el modelo los calcula una vez y los guarda. Cuando llega la siguiente palabra trae una Query fresca, la compara contra las Keys guardadas y agrega una sola fila nueva. Con la cache encendida, el trabajo por palabra pasa de una curva empinada a una línea recta suave. Sigue subiendo, porque el modelo sigue leyendo toda la historia en cada palabra, pero deja de rehacer lo que ya hizo.

El widget separa la cuadrícula pequeña del gráfico de costo a propósito. La cuadrícula muestra cómo es un paso. El gráfico se extiende mucho más allá de la cuadrícula para que sientas la diferencia entre crecer con el cuadrado y crecer en línea recta.

Por qué importa

La cache es la razón por la que los proveedores venden tokens de entrada en cache con un descuento fuerte: si las Keys y los Values de tu prompt ya están en memoria, se saltan recalcularlos. También es la razón por la que las ventanas de contexto tienen tope. Cada token guarda Keys y Values para cada capa, y esa memoria se acumula rápido en una GPU. La grouped-query attention, donde varias heads comparten un mismo juego de Keys y Values, existe para achicar exactamente esa cuenta.

La idea clave

Una memoria diminuta convierte el trabajo de cada palabra nueva de una curva empinada en una línea recta, pero un chat largo nunca es gratis.

Nota honesta: La cuadrícula tiene un puñado de palabras. Un modelo real corre esto sobre miles de tokens, decenas de capas y muchas heads a la vez, y por eso la cache puede ocupar gigabytes de memoria en una sola conversación larga.

Este widget es una etapa de una lección completa, con la historia alrededor.

Gratis, sin código, sin registro.

Inserta este widget

Pega esto en cualquier página HTML, plataforma de cursos, wiki o herramienta de diapositivas que acepte un iframe. Funciona sin cuenta, no pone cookies propias y enlaza de vuelta aquí.

La atribución ya viene incluida. Si escribes sobre él, un enlace a esta página es todo lo que pedimos.

Preguntas frecuentes

¿La KV cache hace gratis las conversaciones largas?
No. Solo elimina el recálculo desperdiciado. Cada palabra nueva sigue leyendo todas las Keys y Values guardadas, así que el costo por palabra sigue subiendo con el largo de la conversación, y la propia cache sigue comiendo memoria mientras crece.
¿Por qué mi app de chat olvida el principio de una conversación larga?
Porque la app recorta o resume los turnos viejos para mantenerse bajo el límite de contexto del modelo. El modelo pelado no olvida con gracia; simplemente no puede correr más allá de su largo máximo. Administrar el contexto es tarea de la app, no del modelo.
¿Puedo insertar este widget de KV cache en mi propio material?
Sí. Copia el fragmento iframe de esta página en la página de un curso, un artículo o una diapositiva. Funciona sin cuenta y enlaza de vuelta a la lección completa sobre ventanas de contexto y cache.

Explicadores relacionados

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.