El modelo piensa antes de responder
Los problemas difíciles hay que trabajarlos. Pero el modelo responde en una sola pasada, sin papel de borrador para pensar.
La idea que hay dentro
Los modelos de razonamiento gastan tokens en una cadena de pensamiento privada antes de la respuesta final.
Después de esta lección
Puedes explicar por qué los modelos de razonamiento piensan antes de responder, y que el 'pensar' son tokens generados.
Adónde lleva
Si pensar son solo tokens, puedes comprar más, una nueva forma de escalar.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Los modelos de razonamiento gastan tokens en una cadena de pensamiento privada antes de la respuesta final.
La pregunta con la que abre
Los problemas difíciles hay que trabajarlos. Pero el modelo responde en una sola pasada, sin papel de borrador para pensar.
El recorrido, en palabras de la propia lección
- Con el pensar activado, el modelo lo resolvió. Cámbialo de un lado a otro para comparar.
- El modelo soltó un “12” sin más. Cambia el interruptor para que piense primero.
- Responder de un tiro: el modelo tiene que comprometerse con el primerísimo token que predice.
- Mira cómo se gastan los tokens primero, y luego apaga el pensar para comparar.
- Pensar es solo gastar tokens antes de responder. Ese es todo el truco.
- "Pensar" es solo generar tokens y gastarlos antes de la respuesta.
- Dentro del modelo no hay papel borrador, solo un flujo de tokens.
- El modelo escribe su razonamiento (en privado), y cada uno de esos tokens le da más pasos para acertar en la parte difícil.
- Los modelos de razonamiento vienen configurados para hacer esto por defecto: el mismo predictor, solo que ajustado para resolverlo primero (cómo funciona ese ajuste es una optativa más adelante).
- Un modelo de razonamiento literalmente piensa, reflexionando sobre el problema como lo haría una persona.
- Solo gasta más cómputo en inference escribiendo pasos intermedios antes de responder. Eso es más cálculo, no consciencia, y más pasos pueden igual llegar a una respuesta equivocada.
- En un problema difícil de varios pasos, un modelo de razonamiento es más lento y cuesta más que un modelo de chat rápido, pero acierta donde el rápido suelta una respuesta equivocada. ¿Qué estás pagando?
- Razonar significa que el modelo genera una chain of thought privada, gastando tokens para resolver el problema antes de comprometerse con una respuesta. Esos tokens extra son la parte más lenta y cara, así que usa un modelo de razonamiento en tareas difíciles de varios pasos y uno más rápido para consultas simples donde resolver paso a paso es esfuerzo desperdiciado.
- Listo de pensar. El modelo resolvió el problema y luego respondió.
- Sin resolverlo: el primer token ES el compromiso. El prompt está saturado de 12, así que la respuesta se ve atraída hacia el 12 antes de que pueda resolver nada.
- El razonamiento nunca sale del modelo. Solo ves la respuesta que se ganó.
- Respondió de un tiro. El prompt está saturado de 12, así que el primer token se ve atraído hacia el 12 antes de que pueda resolver nada.
- Sin pensar: el mismo modelo, sin gastar tokens primero; el mismo error de antes.
La idea clave
Pensar son tokens: el modelo razona en voz alta (en privado), luego responde, y acierta en problemas más difíciles.
Qué puedes hacer después de esta lección
Puedes explicar por qué los modelos de razonamiento piensan antes de responder, y que el 'pensar' son tokens generados.
Ponte a prueba: ¿Qué es el 'pensar' de un modelo de razonamiento?
- Tokens extra que genera para razonar antes de responder(correcta)
- Una búsqueda aparte en una base de datos
- Un vocabulario más grande
- Hardware más lento
Pensar es solo más tokens generados antes de la respuesta, un borrador. Gastar esos tokens suele ayudar, pero es generación de texto, no una consulta oculta.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Modelos de razonamiento
Adónde lleva: Si pensar son solo tokens, puedes comprar más, una nueva forma de escalar.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.