Cómputo en inferencia: paga al responder
Los modelos más grandes cuestan una fortuna entrenarlos. ¿Entrenar es la única forma de comprar más capacidad?
La idea que hay dentro
Un tercer eje de escalado: gasta más cómputo por pregunta en la inferencia para ganar precisión.
Después de esta lección
Puedes explicar el cómputo en inferencia como una tercera forma de escalar, y su compensación de costo/latencia.
Adónde lleva
Pero más pensamiento no siempre es mejor, hay un dial, y un punto óptimo.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Un tercer eje de escalado: gasta más cómputo por pregunta en la inferencia para ganar precisión.
La pregunta con la que abre
Los modelos más grandes cuestan una fortuna entrenarlos. ¿Entrenar es la única forma de comprar más capacidad?
El recorrido, en palabras de la propia lección
- El dinero del entrenamiento ya se gastó. Arrastra el dial de esfuerzo: compra una mejor respuesta para esta única pregunta, ahora mismo.
- Predice: a medida que gastamos más cómputo por pregunta, ¿qué forma traza la precisión?
- Acabas de gastar cómputo al momento de responder. Ponle nombre al contraste: train-time vs test-time.
- Un tercer eje de escalado, pagado por pregunta, bajo demanda.
- La forma de subir y aplanarse es el efecto real y documentado; los números de precisión y costo son inventados, no benchmarks.
- 1× = una respuesta rápida · 16× = piensa largo, o genera 16 y quédate con la mejor. Cuando generas varios intentos en lugar de pensar más tiempo, los intentos pueden correr en paralelo, así que pagas más en cómputo, pero no siempre más tiempo de reloj.
- La precisión ya casi se aplanó aquí arriba, pero el costo no: cada intento extra cuesta lo mismo que el primero. Pensar más compra precisión, a un precio.
- Mismos pesos, misma pregunta. Los dos diales de train-time (más parámetros, más datos) se gastaron antes de que se hiciera esta pregunta, este dial lo giras al momento de responder.
- ¿Qué le pasa a la precisión a medida que gastamos más cómputo por pregunta?
- Mismos pesos, misma pregunta, solo dejamos que el modelo piense más tiempo, o que genere varias respuestas y se quede con la que más intentos coinciden.
- Sube y luego se aplana. Los primeros intentos extra ayudan mucho; los siguientes apenas mueven la aguja, ni siquiera tokens infinitos pueden empujar a un modelo más allá de su propio techo.
- Apostaste por plana. Decisión razonable, pero no: pensar en voz alta sí atrapa errores al principio, así que la precisión sube en un comienzo.
- Apostaste por que sube para siempre. Una esperanza razonable, pero a cada intento extra le queda menos por arreglar, así que las ganancias se encogen y la curva se dobla hasta aplanarse.
- ¿Cómo se convierte más cómputo en una mejor respuesta?
- De dos formas. El modelo puede escribir un chain of thought más largo, generando más tokens de razonamiento antes de comprometerse, o puede generar varias respuestas independientes y quedarse con la que más intentos coinciden (un voto por mayoría). De cualquier modo es solo más tokens generados (lección 4.8), así que las ganancias se encogen una vez que los errores fáciles ya están atrapados.
- Ambos diales de train-time se pagan una sola vez, por adelantado, una fortuna en GPUs, congelada en los pesos. El dial que acabas de arrastrar es distinto: gasta cómputo al momento de responder, por pregunta, bajo demanda.
- Un acertijo de lógica difícil acaba de dejar trabado a tu modelo. La solución de manual es entrenar uno más grande, pero en la lección 4.4 vimos que ambos diales de train-time (más parámetros, más datos) se gastan antes de que se haga pregunta alguna. Esta lección trata de un dial que puedes girar al momento de responder.
- El escalado de train-time es fijo y se compra por adelantado; el de test-time gasta más por pregunta en la inferencia (al momento de responder, no durante el entrenamiento). Compra precisión real, pero el costo y la latencia siguen subiendo con cada unidad extra de esfuerzo. Ese trade-off es justo por lo que los modelos de razonamiento te dan un dial de esfuerzo.
- El mismo chatbot responde una pregunta de trivia al instante, pero tarda 30 segundos en una prueba matemática difícil, y la acierta. ¿Qué hace distinto?
- Está gastando más test-time compute en la pregunta difícil: piensa más tiempo o muestrea varios intentos y se queda con el mejor. En la práctica: puedes subir el esfuerzo solo en las pocas peticiones difíciles, en vez de pagar por un modelo más grande en todas.
- Pensar más compra precisión, a un precio. Pero ¿dónde FIJAS el dial para cada tarea? Próxima lección.
- La precisión sube de forma pronunciada al principio y luego se aplana, mientras el costo crece en línea recta.
La idea clave
Puedes comprar capacidad al momento de responder, no solo al entrenar.
Qué puedes hacer después de esta lección
Puedes explicar el cómputo en inferencia como una tercera forma de escalar, y su compensación de costo/latencia.
Ponte a prueba: Además de modelos más grandes y más datos, ¿cómo más puedes subir la precisión?
- Gastar más cómputo por pregunta al momento de responder(correcta)
- Poner siempre la temperatura en 0
- Usar un prompt más corto
- Desactivar todas las herramientas
Cómputo en el momento de responder: deja que el modelo piense más o pruebe más intentos por pregunta. Compras precisión al responder, no solo al entrenar.
Adónde lleva: Pero más pensamiento no siempre es mejor, hay un dial, y un punto óptimo.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.