Dentro de un turno: razonar, luego actuar
Has visto girar el bucle. Pero ¿qué hace en realidad el agente en un solo turno?
La idea que hay dentro
En cada turno escribe un pensamiento privado, elige UNA llamada a herramienta y luego lee el resultado.
Después de esta lección
Puedes explicar el bucle ReAct: razonar → actuar → observar en cada turno, y por qué los agentes 'piensan' antes de cada llamada a herramienta.
Adónde lleva
Un turno funciona. Pero la primera edición de un agente suele estar mal, ¿cómo llega a ser confiable?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
En cada turno escribe un pensamiento privado, elige UNA llamada a herramienta y luego lee el resultado.
La pregunta con la que abre
Has visto girar el bucle. Pero ¿qué hace en realidad el agente en un solo turno?
El recorrido, en palabras de la propia lección
- Revela el pensamiento del agent y luego elige UNA acción. Mira cómo vuelve el resultado.
- Apaga el razonamiento: adivina de una. Enciéndelo: se recupera.
- Dos formas en que un turno falla. Activa cada una y lee la cinta.
- Razonar → actuar → observar, cada turno. Ese es el bucle ReAct.
- Un turno no es de una. El agent escribe un plan privado, hace una sola llamada a herramienta y luego lee la observación que vuelve, y esa observación reescribe el siguiente pensamiento.
- Intercalar razonar y actuar en cada turno es por lo que el agent narra un plan antes de actuar, y por lo que puede notar un error y recuperarse en vez de seguir adelante con confianza.
- Una simplificación que conviene saber: ReAct es la receta de 2022 que esta lección escenifica. Los modelos modernos la internalizaron: intercalan el pensamiento con las llamadas a herramientas de forma nativa, y a menudo agrupan varias acciones en un turno en vez de exactamente una.
- Cambia la hoja por código y nada cambia: un test que falla hace el papel del reporte descuadrado, y el agent lee el test, lee el archivo, edita y vuelve a correr. Esa traza es lo que los coding agents narran todo el día.
- Le preguntas a un agent por qué el total de un reporte se ve mal. Narra 'déjame abrir primero la hoja', revisa una cosa, lee lo que volvió y luego cambia su plan. ¿Por qué trabajar así en vez de responder de una?
- Ese es el loop ReAct: cada turno es razonar, luego una acción, luego observar el resultado real, que reescribe el siguiente pensamiento. Actuar sobre una observación fresca en vez de adivinar de una es justo lo que le permite atrapar un error y recuperarse.
- El descuadre es vago. No debería adivinar: abro la hoja primero para ver cómo se calcula el total.
- Bien: una lectura barata, y el siguiente pensamiento ya se apoya en hechos.
- Actuó antes de entender. La observación vuelve y corrige el plan: eso es el bucle salvándolo.
- Casi nunca. Lo que las apps te muestran es un resumen narrado que el modelo escribe para ti; el borrador privado completo suele quedar oculto.
- No adivines. Abre la hoja para ver cómo se calcula el total.
- Sin pensamiento, de una, una adivinanza confiada y equivocada. El reporte sigue mal.
- Activa un modo de fallo para ver cómo se rompe un turno.
- La misma acción, la misma observación fallida, para siempre: el plan nunca se actualiza. Un harness limita los turnos para salir.
- Escribió la observación él mismo en vez de leer la salida real de la herramienta, y luego 'terminó' un trabajo que sigue roto.
La idea clave
Puedes leer la traza pensar → actuar → observar de un agente, y ver por qué narra un plan y se recupera de errores.
Qué puedes hacer después de esta lección
Puedes explicar el bucle ReAct: razonar → actuar → observar en cada turno, y por qué los agentes 'piensan' antes de cada llamada a herramienta.
Ponte a prueba: En el bucle ReAct, ¿qué pasa en cada turno?
- Razonar (un pensamiento) → actuar (una llamada a herramienta) → observar el resultado(correcta)
- Responde de inmediato de una sola vez
- Le pregunta al usuario antes de cada token
- Reentrena el modelo
Cada turno es razonar (un pensamiento breve), actuar (una llamada a herramienta) y luego observar el resultado, que guía el siguiente pensamiento. Ese bucle es el agente.
Adónde lleva: Un turno funciona. Pero la primera edición de un agente suele estar mal, ¿cómo llega a ser confiable?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.