Saltar al contenido
todas las lecciones
Agentes en la práctica6.4Bloqueada

Prompt caching: reutiliza el prefijo

Reenvías el mismo system prompt largo y los mismos archivos en cada turno. ¿No es un desperdicio?

La idea que hay dentro

Guarda en caché el prefijo estable: el modelo lo procesa una vez y luego lo reutiliza mucho más barato.

Después de esta lección

Puedes explicar el prompt caching y por qué poner primero el contenido estable reduce costo y latencia.

Adónde lleva

El caching es un truco del harness. ¿y las herramientas que el propio modelo usa?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Guarda en caché el prefijo estable: el modelo lo procesa una vez y luego lo reutiliza mucho más barato.

La pregunta con la que abre

Reenvías el mismo system prompt largo y los mismos archivos en cada turno. ¿No es un desperdicio?

El recorrido, en palabras de la propia lección

  • Por esto los chats largos responden rápido y los system prompts gigantes salen asequibles. Arrastra los turnos y luego activa o desactiva el cache.
  • Predice: ¿después de cuántas reutilizaciones vale la pena pagar por cachear el prefijo?
  • Cada turno reenvía el mismo system prompt largo, las herramientas y los archivos. ¿No es un desperdicio?
  • Lo estable primero, byte a byte. Luego reutilízalo por casi nada.
  • Cada turno reenvía el prefijo idéntico, y sin cache pagas por releerlo entero una y otra vez. Ambas barras suman ese costo de entrada; arrastra los turnos y mira cómo se abre la brecha.
  • Un acierto de cache necesita una coincidencia byte a byte. Editar el inicio del prompt lo cambia, así que el cache ya no coincide y el prefijo se reescribe a 1,25×. A partir de ahí pagas precio completo hasta que el cache se vuelva a calentar, por eso mantienes lo estable primero y nunca lo tocas.
  • Cachear no es gratis: el primer turno paga 1,25× por escribir el prefijo. Pero cada turno posterior lo lee a 0,1×, un 90% de descuento.
  • Entonces, ¿después de cuántas reutilizaciones el cache empieza a ahorrarte dinero?
  • Solo una. El 0,25× extra de la escritura es mínimo; una sola lectura a 0,1× en vez de volver a cobrar el 1× completo ya gana.
  • El gran prefijo azul es idéntico en cada turno; solo cambia el mensaje fino. Ese bloque idéntico es exactamente lo que se cachea y se reutiliza.
  • El prefijo es el system prompt, las definiciones de herramientas y los archivos adjuntos: el andamiaje estable del context window (lección 6.2). Puede tener miles de tokens. El último mensaje del usuario suele ser diminuto en comparación, y aun así cada petición nueva vuelve a cobrar todo desde cero en cada turno.
  • Dos cosas que el cache no es: no es memoria sobre ti, guarda la lectura ya procesada del prefijo (los KV states de la lección 4.2); y no es permanente, caduca en minutos, así que un chat retomado después del almuerzo vuelve a pagar la escritura.
  • En cache, el prefijo se amortiza tras un solo turno, siempre que el inicio quede idéntico byte a byte. Es el mismo truco que
  • Notas que el agent relee las mismas instrucciones enormes en cada turno, y aun así los turnos siguen rápidos y tu límite de uso no queda hecho trizas. ¿Por qué?
  • Prompt caching: el prefijo compartido se cobra y se procesa una sola vez, y luego se reutiliza con cerca de un 90% de descuento mientras quede idéntico byte a byte. Por eso los equipos que construyen sobre estos modelos también estructuran los prompts con la parte estable primero, para que el cache siga coincidiendo.

La idea clave

Pon primero el contenido estable y reutilízalo; el caching convierte el contexto repetido de caro a casi gratis.

Qué puedes hacer después de esta lección

Puedes explicar el prompt caching y por qué poner primero el contenido estable reduce costo y latencia.

Ponte a prueba: El prompt caching ahorra más cuando…
  • Reutilizas un prefijo sin cambios entre turnos(correcta)
  • Cambias el system prompt en cada turno
  • Envías prompts cortos de una sola vez
  • Apagas todas las herramientas

El caché reutiliza el trabajo de un prefijo que no cambia. Mantén estable el system prompt y el contexto inicial y solo pagas por procesar lo nuevo.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Prompt caching

Adónde lleva: El caching es un truco del harness. ¿y las herramientas que el propio modelo usa?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.