Conciencia de tokens y la economía
Dos prompts dan la misma respuesta, pero uno cuesta 10× y va más lento. ¿Por qué?
La idea que hay dentro
Cada token de entrada y de salida cuesta dinero y tiempo, así que pocos tokens bien elegidos ganan a muchos.
Después de esta lección
Puedes razonar sobre el costo y la latencia de los tokens, y tomar decisiones deliberadas (caching, recuperación, poda).
Adónde lleva
Ya manejas las herramientas, pero ¿qué pasa de verdad en cada turno del bucle?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Cada token de entrada y de salida cuesta dinero y tiempo, así que pocos tokens bien elegidos ganan a muchos.
La pregunta con la que abre
Dos prompts dan la misma respuesta, pero uno cuesta 10× y va más lento. ¿Por qué?
El recorrido, en palabras de la propia lección
- Arrastra la longitud de salida. Mira cómo se mueven la cifra en dólares y la espera.
- Las barras grandes son una comparación fija de todo-apagado frente a todo-encendido. Activa las palancas para mover tu propia cuenta por turno de abajo.
- Cada token que entra y sale se cobra. Gasta context a propósito.
- Precios representativos de gama media de 2026; las tarifas reales varían según el modelo y el proveedor.
- La salida se cobra a 5× la tarifa de entrada, y es lo que marca la latencia.
- El historial viaja en cada turno, así que la entrada va subiendo con el tiempo.
- La facturación cuenta tokens, no respuestas. La salida se cobra a 5× la tarifa de entrada y es lo que esperas, mientras la entrada va subiendo porque todo el repo y el historial del chat (6.2) viajan en cada turno.
- Ambas mitades se cobran. La salida cuesta más por token (el modelo genera cada uno) y además es lo que te hace esperar.
- Prompt caching (6.4): el prefijo estable se lee a 0,1×: un 90% de descuento sobre el grueso que reenvías.
- Deja que el agent traiga solo los fragmentos relevantes (6.9) en vez de todo el repo: muchos menos tokens de entrada.
- Recorta el context (6.3): quédate con los últimos turnos, no con todo el chat.
- Más context puede ayudar, pero también cuesta más, va más lento y arriesga el context rot (6.3), donde la señal se ahoga en ruido. Entonces: cachea el prefijo estable, recupera en vez de volcar, poda el historial viejo.
- Cuando nadie está esperando la respuesta, el trabajo puede ir a una cola para procesarse barato de noche, como un millón de filas clasificadas mientras duermes. Las APIs batch corren esas solicitudes juntas con un gran descuento, cambiando inmediatez por menor costo. Regla general: paga la prima de tiempo real solo donde hay un humano esperando, y manda todo lo demás a batch.
- Tu sesión de agent llega a su límite de uso a media tarde, y las respuestas largas se sienten lentas. ¿Qué se está contando en realidad?
- Tokens, de entrada y de salida. La salida se cobra a varias veces la tarifa de entrada, así que las respuestas largas y el context releído se comen la cuota, y la salida además es lo que esperas. La misma aritmética manda en la factura de API de los equipos que construyen sobre estos modelos.
- Más context puede recordar datos y herramientas que el modelo se perdería de otro modo.
- Cada token extra cuesta dinero y suma latencia.
- Un context inflado arriesga el context rot (6.3): la respuesta se ahoga en tokens irrelevantes.
La idea clave
Puedes tratar costo, latencia y calidad como un solo presupuesto y gastar tokens donde rinden.
Qué puedes hacer después de esta lección
Puedes razonar sobre el costo y la latencia de los tokens, y tomar decisiones deliberadas (caching, recuperación, poda).
Ponte a prueba: ¿Por qué dos prompts con la misma respuesta pueden costar muy distinto?
- Pagas por token de entrada y de salida, menos tokens, bien elegidos, cuestan menos(correcta)
- Los prompts más largos siempre son gratis
- Los tokens de salida nunca se cobran
- El modelo decide el precio
Se cobra por token, tanto enviados como generados. La misma respuesta lograda con menos tokens, mejor elegidos, simplemente cuesta menos.
Adónde lleva: Ya manejas las herramientas, pero ¿qué pasa de verdad en cada turno del bucle?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.