Explicador en lenguaje claro
Prompt caching, pagar una vez por la parte que nunca cambia
¿Qué es el prompt caching y cuánto ahorra de verdad?
Casi todas las peticiones a un asistente repiten una apertura larga e idéntica: las instrucciones del sistema, las definiciones de herramientas, el documento sobre el que preguntas. El prompt caching guarda la forma ya procesada de ese prefijo para que la siguiente petición se salte volver a calcularlo. Los proveedores cobran un descuento grande por la entrada cacheada y además vuelve más rápido. Las reglas son estrictas: el prefijo tiene que coincidir exactamente desde el primer token, y la cache expira tras minutos sin uso, así que premia poner primero lo estable.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Predice la siguiente palabra →Gratis, sin código, sin registro.
Y después ve más a fondo: Prompt caching: reutiliza el prefijo Bloqueada
Lo que la gente entiende mal
- Cachea respuestas. Cachea el prefijo del prompt ya procesado, así que el modelo genera igual una respuesta nueva cada vez.
- Cualquier texto repetido se cachea. La coincidencia tiene que empezar en el primer token, así que un carácter cambiado arriba invalida todo lo que viene después.
- Es dinero gratis. Algunos proveedores cobran un extra por escribir en la cache, así que un prefijo reutilizado una o dos veces puede salir más caro que no cachear.
Dónde lo ves en productos reales
- Agents de código que reenvían un system prompt largo y los mismos archivos en cada turno.
- Asistentes de documentos donde el documento entero es el prefijo compartido por muchas preguntas.
- Bots de soporte con un bloque grande y fijo de instrucciones y conocimiento.
Preguntas frecuentes
- ¿Cómo ordeno el prompt para conseguir aciertos de cache?
- Lo estable primero, lo variable al final. Instrucciones del sistema, definiciones de herramientas y documentos de referencia largos arriba; la pregunta del usuario y cualquier cosa con marca de tiempo abajo. Mover un solo valor cambiante al principio del prompt es la razón más común de que el caching deje de funcionar.
- ¿Cuánto dura un prefijo cacheado?
- Minutos, no días, y varía según el proveedor. Está pensado para una ráfaga de peticiones relacionadas, como una conversación o una corrida de un agent, no como almacenamiento a largo plazo. Algunos proveedores ofrecen un nivel de vida más larga a otro precio.
- ¿El prompt caching es lo mismo que la KV cache?
- Es la misma idea de fondo, reutilizada entre peticiones. La KV cache guarda las keys y values calculadas dentro de una generación; el prompt caching conserva ese trabajo para el prefijo compartido, de modo que una petición posterior empiece desde ahí y no desde cero.
Explicadores relacionados
Más en Velocidad, costo y control
- ¿Qué es el enrutado de modelos, y cómo eliges qué modelo de IA usar?
- ¿Qué es la cuantización y cómo permite correr modelos grandes en hardware pequeño?
- ¿Qué hace de verdad el ajuste de temperatura en un modelo de IA?
- ¿Por qué las GPUs, y no las CPUs, son el hardware del boom de la IA?
- ¿Cómo funcionan de verdad los modelos de razonamiento?
- ¿Qué es el speculative decoding y por qué acelera a los modelos?
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.