Saltar al contenido
todas las lecciones
Sustrato físicoS.3Bloqueada

La economía de la inferencia: lo que cuesta una respuesta

El entrenamiento ocurrió una sola vez, hace tiempo. Entonces, ¿por qué cada respuesta que pides le sigue costando al proveedor tiempo, memoria y dinero reales?

La idea que hay dentro

Las respuestas se sirven token a token: cada token es una pasada por el modelo, la caché KV retiene memoria de GPU durante toda tu respuesta, y el batching, la longitud de la salida y los presupuestos de pensamiento fijan la factura. La cuantización y el enrutamiento son las palancas que la bajan.

Después de esta lección

Puedes explicar por qué una respuesta de IA cuesta tiempo y dinero, servir token a token, la memoria de la caché KV, el batching, la longitud de la salida, y nombrar las palancas que recortan el coste.

Adónde lleva

Más allá del recorrido principal: cómo se alinean, ajustan y examinan los modelos.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Las respuestas se sirven token a token: cada token es una pasada por el modelo, la caché KV retiene memoria de GPU durante toda tu respuesta, y el batching, la longitud de la salida y los presupuestos de pensamiento fijan la factura. La cuantización y el enrutamiento son las palancas que la bajan.

La pregunta con la que abre

El entrenamiento ocurrió una sola vez, hace tiempo. Entonces, ¿por qué cada respuesta que pides le sigue costando al proveedor tiempo, memoria y dinero reales?

El recorrido, en palabras de la propia lección

  • El datacenter entrenó el modelo una vez. ¿Entonces por qué cada respuesta le sigue costando dinero al proveedor?
  • Arma el costo de una respuesta. Arrastra la longitud, activa el razonamiento, cambia el tamaño del modelo.
  • La misma petición difícil. Activa una palanca y mira cómo baja la cuenta, sin bajar la calidad.
  • Una respuesta cuesta tiempo, memoria y dinero, cada vez. Dos palancas lo reducen.
  • El entrenamiento terminó hace meses y los pesos nunca cambian. ¿Entonces por qué cada respuesta que pides le sigue costando al proveedor tiempo, memoria y dinero reales?
  • El entrenamiento pasó una vez. Pero una respuesta se genera token por token, y cada token es una pasada nueva por todo el modelo. Cada respuesta vuelve a correr miles de millones de multiplicaciones, ocupa memoria de GPU todo el tiempo, y el proveedor paga por todo eso, cada vez.
  • Números de juguete de mediados de 2026: los tokens de salida se cobran unos pocos dólares por millón, la memoria de GPU en decenas bajas de GB. Los precios reales varían según el modelo y el proveedor.
  • Cada token de salida es una pasada aparte, así que la longitud fija tanto la cuenta como la espera.
  • Deja que el modelo piense antes de responder. Esos tokens de razonamiento ocultos se cobran como salida, así que la cuenta casi se triplica.
  • Un modelo más grande cuesta más por token y decodifica más lento (escribe la respuesta más despacio).
  • Tres perillas fijan el costo de una respuesta: cuántos tokens genera, si razona primero, y qué modelo la corre. El KV cache, la memoria de trabajo que el modelo mantiene en la GPU mientras escribe tu respuesta (4.2), se queda llena todo el tiempo, y esa memoria es el verdadero recurso escaso.
  • Una GPU atiende muchas peticiones a la vez (batching, S.1/S.2): corre un solo matmul grande para todo el grupo en vez de uno por usuario. Eso reparte el costo fijo de cargar los pesos entre todos, que es lo que hace que los precios por token sean tan bajos. El detalle: el KV cache de cada petición del batch tiene que caber en la memoria de GPU al mismo tiempo, así que la memoria, no el cálculo puro, suele ser lo que limita a cuántos puedes atender.
  • Activa una palanca abajo para reducir la cuenta de esta petición difícil.
  • Corre el modelo con precisión numérica más baja. Más barato por token y casi la mitad de memoria de KV cache, con poca pérdida de calidad en la mayoría de las tareas.
  • Manda la petición a un modelo del tamaño adecuado en vez del más grande. La mayoría de las respuestas no necesitan el modelo estrella.
  • Ahorros ilustrativos. La dirección es real, el multiplicador exacto es inventado.
  • El costo grande es entrenar el modelo. Una vez pagado eso, las respuestas son básicamente gratis.
  • Entrenar es una cuenta de una sola vez. Servir es para siempre: cada respuesta vuelve a correr el modelo token por token y ocupa memoria de GPU todo el tiempo. Servir es ya cerca de dos tercios de todo el cómputo de IA.
  • El costo de una respuesta lo fijan cuántos tokens genera, si razona primero, y qué modelo la corre. Quantization y routing son las palancas que reducen la cuenta sin reducir la calidad.
  • El recurso escaso al servir suele ser la memoria de GPU, no el cálculo. El KV cache (4.2) crece con cada token del contexto y tiene que quedarse residente durante toda la respuesta, así que una respuesta larga o una conversación larga se come la memoria que si no serviría a otros usuarios. Por eso importan el batching, las salidas más cortas, quantization y routing: dejan que una GPU sirva más respuestas por segundo.
  • Tu suscripción al chatbot limita cuántas respuestas 'pensadas' recibes al mes, y las respuestas largas gastan tu cuota más rápido. ¿Por qué el proveedor lo mide así?
  • Cada token que ves cuesta tiempo de GPU y memoria, y los tokens de pensamiento ocultos se cobran igual. Las respuestas largas y el pensar largo multiplican ese costo, así que los límites y el routing a modelos más pequeños son el proveedor pasándote esa aritmética a ti.
  • KV cache: la memoria de trabajo que el modelo mantiene en la GPU mientras escribe tu respuesta (4.2)

La idea clave

Rastreaste de dónde sale el coste de una respuesta, y encontraste la palanca que recorta la factura sin recortar la calidad.

Qué puedes hacer después de esta lección

Puedes explicar por qué una respuesta de IA cuesta tiempo y dinero, servir token a token, la memoria de la caché KV, el batching, la longitud de la salida, y nombrar las palancas que recortan el coste.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Costo de la inferencia

Adónde lleva: Más allá del recorrido principal: cómo se alinean, ajustan y examinan los modelos.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.