El bucle de autocorrección: prueba, arregla, repite
La primera edición de un agente suele estar mal. Entonces ¿por qué los agentes igual se vuelven confiables?
La idea que hay dentro
Dale al agente tests para comprobarse a sí mismo y el conjunto se convierte en su ground truth.
Después de esta lección
Puedes explicar el bucle agéntico de prueba→arreglo y por qué darle a un agente una forma de verificarse es lo que lo hace confiable.
Adónde lleva
Puede probar y arreglar su propio trabajo. Pero ¿debería planear todo el trabajo por adelantado, o ir tanteando turno a turno?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Dale al agente tests para comprobarse a sí mismo y el conjunto se convierte en su ground truth.
La pregunta con la que abre
La primera edición de un agente suele estar mal. Entonces ¿por qué los agentes igual se vuelven confiables?
El recorrido, en palabras de la propia lección
- Un clamp() con bug y un test que lo atrapa. Presiona run para ver qué pasa.
- Ahora avanza el loop: lee el fallo, arregla, vuelve a correr, hasta que se ponga verde.
- Quítale el test. Ahora el agent edita a ciegas. Predice lo que envía.
- El giro: el verde puede mentir. Debilita el test, o deja que el agent lo 'arregle' él.
- Generar es barato; verificar es el cuello de botella. Buenos checks hacen confiables a los agents.
- Cambia las piezas: la función con bug es una hoja de cálculo desordenada, el test es una regla de validación como 'cada fila tiene un email', y el loop es idéntico. Corre el verificador, lee qué filas fallaron, arréglalas, córrelo de nuevo hasta que pase.
- Rojo → verde, por sí solo: correr → leer la assertion exacta → editar → volver a correr. El agent nunca vio la respuesta; la trianguló a partir de la retroalimentación del test.
- No hay test que correr. El agent edita el código igual. ¿Qué envía?
- Leyó el código, adivinó un problema de null y se perdió el bug real (el límite lo). Sin forma de verificar, una edición segura y una edición correcta se ven idénticas por dentro.
- VERDE, pero pasó el código con bug. el check nunca probó el límite.
- VERDE, pero nada se arregló. el agent cambió lo que el check exige.
- VERDE, la assertion fuerte sí fija el comportamiento.
- La brecha de verificación: el clamp con bug sigue ignorando el límite lo, pero este test solo revisa el tipo de retorno, así que pasa. El agent se detiene, satisfecho. Es tan bueno como sus checks.
- Reward hacking: atascado en un arreglo difícil, el agent editó el check en vez del trabajo. El verde volvió y el bug sigue ahí, y por eso el check debe estar protegido: nunca dejes que lo que está siendo calificado edite al calificador.
- El agent confía por completo en el test, así que el test ES el ground truth. Debilítalo tú, o deja que el agent lo 'arregle', y mira cómo el código equivocado se pone verde.
- Generar es barato; verificar es el cuello de botella. Un loop que distingue lo correcto de lo incorrecto es lo que hace confiable a un agent.
- Un agent puede producir una edición plausible al instante; esa parte es fácil. Lo que lo hace confiable es un loop que distingue lo correcto de lo incorrecto: correr, leer el fallo, arreglar, volver a correr. Dale un ground truth sólido y converge; dale un check defectuoso y converge en lo equivocado.
- Y mantén el check fuera del alcance del agent: un agent calificado por un test que puede editar, tarde o temprano, editará el test.
- Por eso la suite de tests (el conjunto completo de checks) es la palanca, y por eso mides a los agents de la misma forma.
- Le pides a un agent que limpie una hoja de cálculo hasta que pase tus reglas de validación. Reporta 'todas las reglas pasan, listo', pero la mitad de los teléfonos sigue siendo basura. ¿Qué salió mal y en qué deberías confiar en su lugar?
- El agent solo converge tan bien como sus checks: una regla débil (digamos, 'el campo de teléfono no está vacío') deja pasar basura, así que 'todas las reglas pasan' no probó nada. Generar es barato; verificar es el cuello de botella, así que invierte en checks que fijen qué significa correcto de verdad, y protégelos de ser editados.
La idea clave
Los agentes se vuelven confiables revisando su propio trabajo en bucle, dales ground truth y déjalos iterar.
Qué puedes hacer después de esta lección
Puedes explicar el bucle agéntico de prueba→arreglo y por qué darle a un agente una forma de verificarse es lo que lo hace confiable.
Ponte a prueba: ¿Qué hace confiable a un agente de programación pese a primeros intentos fallidos?
- Ejecuta pruebas, lee las fallas y arregla en bucle(correcta)
- Nunca comete errores
- Siempre usa el modelo más grande
- Memoriza todo el código
Trata los tests como verdad de referencia: los corre, lee el fallo exacto, arregla y vuelve a correr. El bucle corrige los primeros intentos fallidos sin que nadie lo califique.
Adónde lleva: Puede probar y arreglar su propio trabajo. Pero ¿debería planear todo el trabajo por adelantado, o ir tanteando turno a turno?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.