Explicador en lenguaje claro
Lo que cuesta de verdad una respuesta de IA
¿Por qué operar IA es tan caro y qué estás pagando?
Cada respuesta se calcula desde cero en hardware que hay que reservar lo uses o no. No hay una página cacheada que servir. El costo escala con los tokens de tu prompt más los tokens generados, y la generación es la mitad cara porque cada token nuevo obliga a volver a leer el modelo entero desde la memoria. Por eso los precios se cotizan por token, por eso la salida cuesta varias veces más que la entrada, y por eso el contexto largo y el pensar largo aparecen los dos en la factura.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Por qué las GPUs ganan a las CPUs →Gratis, sin código, sin registro.
Y después ve más a fondo: La economía de la inferencia: lo que cuesta una respuesta Bloqueada
Lo que la gente entiende mal
- El costo lo domina el entrenamiento. El entrenamiento es un gasto enorme de una vez, y en un producto popular el costo acumulado de servir respuestas lo supera.
- Los precios solo bajan. El precio por token ha caído mucho, y los modelos de razonamiento gastan muchos más tokens por respuesta, así que el costo de una tarea no ha bajado tan rápido como el costo de un token.
- Un plan gratis es gratis de operar. Es un costo de marketing pagado en tiempo de GPU, y por eso los planes gratis reciben modelos más chicos, límites más ajustados y menos prioridad.
Dónde lo ves en productos reales
- Los topes de mensajes y las bajadas de velocidad en las suscripciones de consumo.
- El precio por token en las APIs, con la salida más cara que la entrada y descuento por entrada cacheada.
- Niveles de modelo barato y caro ofrecidos lado a lado para la misma tarea.
Preguntas frecuentes
- ¿Por qué la salida cuesta más que la entrada?
- La entrada se procesa en una sola pasada paralela, que aprovecha bien el hardware. La salida se produce token a token, y cada token necesita volver a leer los pesos del modelo desde la memoria. El mismo acelerador produce muchos menos tokens de salida por segundo de los que puede absorber de entrada, y el precio sigue a eso.
- ¿Qué hace que una petición sea más cara que otra?
- El largo del prompt, el largo de la salida y si se le pidió al modelo pensar antes. Un modelo de razonamiento puede gastar miles de tokens ocultos antes de escribir una respuesta corta, así que una respuesta de dos líneas no dice lo que costó.
- ¿Cómo bajo mi factura de IA sin perder calidad?
- Por orden de rendimiento: manda las peticiones fáciles a un modelo más barato, cachea el prefijo estable de tus prompts, recorta el contexto que envías y limita el largo de la salida. Casi todas las facturas grandes vienen de reenviar mucho más contexto del que la tarea necesita en cada llamada.
Explicadores relacionados
Más en Velocidad, costo y control
- ¿Qué es la cuantización y cómo permite correr modelos grandes en hardware pequeño?
- ¿Qué hace de verdad el ajuste de temperatura en un modelo de IA?
- ¿Cómo funcionan de verdad los modelos de razonamiento?
- ¿Qué es el speculative decoding y por qué acelera a los modelos?
- ¿Qué es el prompt caching y cuánto ahorra de verdad?
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.