Explicador en lenguaje claro
Modelos de razonamiento, o por qué algunas respuestas tardan más
¿Cómo funcionan de verdad los modelos de razonamiento?
Un modelo de razonamiento escribe un borrador largo y privado antes de responder. Ese borrador se genera igual que cualquier otro texto, token a token, pero le da al modelo un lugar donde partir el problema en pasos, probar un camino y corregirse. Gastar más tokens en el momento de responder mejora de forma consistente las matemáticas difíciles, el código y la lógica de varios pasos. Cuesta más y tarda más, y en preguntas simples no aporta nada.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Del internet a tu respuesta →Gratis, sin código, sin registro.
Y después ve más a fondo: El modelo piensa antes de responder Bloqueada
Lo que la gente entiende mal
- El modelo piensa de una forma nueva. Genera tokens exactamente igual que antes, solo que muchos más antes de comprometerse con una respuesta.
- El resumen visible es el razonamiento real. Casi todos los productos muestran un boceto limpio, no la traza cruda, así que es una guía aproximada y no un registro auditable.
- El modo razonamiento siempre es mejor. En tareas de búsqueda y formato agrega latencia y costo sin ganancia, y por eso los productos te dejan apagarlo.
Dónde lo ves en productos reales
- El interruptor de pensar o razonamiento extendido en un asistente de chat.
- Ajustes de esfuerzo por respuesta en las APIs, cobrados por los tokens con los que el modelo piensa.
- Herramientas de código que planifican un cambio de varios archivos antes de tocar ninguno.
Preguntas frecuentes
- ¿Qué es el test-time compute?
- Gastar más cómputo cuando se hace la pregunta, no solo durante el entrenamiento. Razonar más largo, hacer varios intentos y puntuarlos entre sí, o buscar entre respuestas candidatas. Es una segunda forma de comprar calidad sin entrenar un modelo más grande.
- ¿Puedo ver lo que el modelo está pensando?
- Normalmente solo un resumen. Los laboratorios se guardan la traza cruda por motivos competitivos y de seguridad, y lo que se muestra es una versión limpia. Sirve para seguir la forma del enfoque, no como prueba de cómo se llegó a la respuesta.
- ¿Cuándo no conviene un modelo de razonamiento?
- Cuando la tarea es buscar, extraer, dar formato o charlar corto. Pagas los tokens de pensamiento extra y esperas más por una respuesta que un modelo rápido acierta igual. Guárdalo para problemas donde un paso intermedio equivocado arruina el resultado.
Explicadores relacionados
Más en Velocidad, costo y control
- ¿Qué es el enrutado de modelos, y cómo eliges qué modelo de IA usar?
- ¿Qué es la KV cache y por qué importa para la velocidad y el costo?
- ¿Qué es la cuantización y cómo permite correr modelos grandes en hardware pequeño?
- ¿Qué hace de verdad el ajuste de temperatura en un modelo de IA?
- ¿Por qué las GPUs, y no las CPUs, son el hardware del boom de la IA?
- ¿Qué es el speculative decoding y por qué acelera a los modelos?
- ¿Qué es el prompt caching y cuánto ahorra de verdad?
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.