Saltar al contenido

Explicador en lenguaje claro

Modelos de razonamiento, o por qué algunas respuestas tardan más

¿Cómo funcionan de verdad los modelos de razonamiento?

Un modelo de razonamiento escribe un borrador largo y privado antes de responder. Ese borrador se genera igual que cualquier otro texto, token a token, pero le da al modelo un lugar donde partir el problema en pasos, probar un camino y corregirse. Gastar más tokens en el momento de responder mejora de forma consistente las matemáticas difíciles, el código y la lógica de varios pasos. Cuesta más y tarda más, y en preguntas simples no aporta nada.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: El modelo piensa antes de responder Bloqueada

Lo que la gente entiende mal

  • El modelo piensa de una forma nueva. Genera tokens exactamente igual que antes, solo que muchos más antes de comprometerse con una respuesta.
  • El resumen visible es el razonamiento real. Casi todos los productos muestran un boceto limpio, no la traza cruda, así que es una guía aproximada y no un registro auditable.
  • El modo razonamiento siempre es mejor. En tareas de búsqueda y formato agrega latencia y costo sin ganancia, y por eso los productos te dejan apagarlo.

Dónde lo ves en productos reales

  • El interruptor de pensar o razonamiento extendido en un asistente de chat.
  • Ajustes de esfuerzo por respuesta en las APIs, cobrados por los tokens con los que el modelo piensa.
  • Herramientas de código que planifican un cambio de varios archivos antes de tocar ninguno.

Preguntas frecuentes

¿Qué es el test-time compute?
Gastar más cómputo cuando se hace la pregunta, no solo durante el entrenamiento. Razonar más largo, hacer varios intentos y puntuarlos entre sí, o buscar entre respuestas candidatas. Es una segunda forma de comprar calidad sin entrenar un modelo más grande.
¿Puedo ver lo que el modelo está pensando?
Normalmente solo un resumen. Los laboratorios se guardan la traza cruda por motivos competitivos y de seguridad, y lo que se muestra es una versión limpia. Sirve para seguir la forma del enfoque, no como prueba de cómo se llegó a la respuesta.
¿Cuándo no conviene un modelo de razonamiento?
Cuando la tarea es buscar, extraer, dar formato o charlar corto. Pagas los tokens de pensamiento extra y esperas más por una respuesta que un modelo rápido acierta igual. Guárdalo para problemas donde un paso intermedio equivocado arruina el resultado.

Explicadores relacionados

Más en Velocidad, costo y control

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.