Saltar al contenido

Explicador en lenguaje claro

Modelos de razonamiento, o por qué algunas respuestas tardan más

Un modelo de razonamiento es un modelo de lenguaje entrenado para escribir una cadena larga y casi siempre oculta de pasos intermedios antes de comprometerse con una respuesta. Genera esos pasos token a token como cualquier texto, lo que le permite descomponer un problema, probar un camino y corregirse. Cambia más tiempo y tokens por mejores resultados en problemas difíciles.

¿Cómo funcionan de verdad los modelos de razonamiento?

Un modelo de razonamiento escribe un borrador largo y privado antes de responder. Ese borrador se genera igual que cualquier otro texto, token a token, pero le da al modelo un lugar donde partir el problema en pasos, probar un camino y corregirse. Gastar más tokens en el momento de responder mejora de forma consistente las matemáticas difíciles, el código y la lógica de varios pasos. Cuesta más y tarda más, y en preguntas simples no aporta nada.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: El modelo piensa antes de responder Bloqueada

Lo que la gente entiende mal

  • El modelo piensa de una forma nueva. Genera tokens exactamente igual que antes, solo que muchos más antes de comprometerse con una respuesta.
  • El resumen visible es el razonamiento real. Casi todos los productos muestran un boceto limpio, no la traza cruda, así que es una guía aproximada y no un registro auditable.
  • El modo razonamiento siempre es mejor. En tareas de búsqueda y formato agrega latencia y costo sin ganancia, y por eso los productos te dejan apagarlo.

Dónde lo ves en productos reales

  • El interruptor de pensar o razonamiento extendido en un asistente de chat.
  • Ajustes de esfuerzo por respuesta en las APIs, cobrados por los tokens con los que el modelo piensa.
  • Herramientas de código que planifican un cambio de varios archivos antes de tocar ninguno.

Preguntas frecuentes

¿Qué es el test-time compute?
Gastar más cómputo cuando se hace la pregunta, no solo durante el entrenamiento. Razonar más largo, hacer varios intentos y puntuarlos entre sí, o buscar entre respuestas candidatas. Es una segunda forma de comprar calidad sin entrenar un modelo más grande.
¿Puedo ver lo que el modelo está pensando?
Normalmente solo un resumen. Los laboratorios se guardan la traza cruda por motivos competitivos y de seguridad, y lo que se muestra es una versión limpia. Sirve para seguir la forma del enfoque, no como prueba de cómo se llegó a la respuesta.
¿Cuándo no conviene un modelo de razonamiento?
Cuando la tarea es buscar, extraer, dar formato o charlar corto. Pagas los tokens de pensamiento extra y esperas más por una respuesta que un modelo rápido acierta igual. Guárdalo para problemas donde un paso intermedio equivocado arruina el resultado.
¿Los modelos de razonamiento se entrenan distinto?
Sí. Tras el pre-entrenamiento normal reciben una fase de aprendizaje por refuerzo sobre problemas con respuesta verificable, como matemáticas y código, donde el modelo es recompensado cuando su respuesta final es correcta. Eso le enseña a gastar tokens en un desarrollo que de verdad mejora la respuesta, en vez de solo escribir más.
¿Un modelo de razonamiento cuesta más usarlo?
Sí, en tokens y en tiempo. Los tokens de razonamiento ocultos se generan y se cobran como cualquier salida, así que una pregunta difícil puede costar varias veces una respuesta simple y tardar mucho más. Los productos exponen un presupuesto de pensamiento o un interruptor para que pagues el razonamiento solo donde ayuda.

Explicadores relacionados

Más en Velocidad, costo y control

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.