Evals: demostrar que funciona
Ajustas el prompt y 'se siente' mejor. ¿Lo es, o acabas de romper otros tres casos?
La idea que hay dentro
Crea un conjunto de evals con entradas emparejadas con las respuestas esperadas, y luego puntúa cada cambio.
Después de esta lección
Puedes explicar el desarrollo guiado por evals: conjuntos de prueba, puntuación y detección de regresiones.
Adónde lleva
Pero ¿quién califica miles de respuestas abiertas? A menudo, otro modelo.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Crea un conjunto de evals con entradas emparejadas con las respuestas esperadas, y luego puntúa cada cambio.
La pregunta con la que abre
Ajustas el prompt y 'se siente' mejor. ¿Lo es, o acabas de romper otros tres casos?
El recorrido, en palabras de la propia lección
- Predice: ¿la edición romperá algo? Luego aplícala y observa cómo reacciona cada fila.
- Los evals convierten las 'sensaciones' en un número que puedes defender, y en una compuerta que puedes automatizar.
- Un suite de juguete con 5 casos inventados; los eval sets reales corren cientos.
- Dos casos fallan con el prompt A, y la edición (B) busca arreglarlos. ¿B romperá algo que hoy pasa?
- Esto es un eval set (un golden dataset): un panel de cata que cada receta nueva debe pasar antes de entrar al menú, inputs reales emparejados con las respuestas correctas. Los ingenieros llaman a este patrón tests unitarios. Fija tu predicción, luego aplica la edición y deja que la tabla responda.
- Dos rojos se volvieron verdes, pero un verde se volvió rojo: el caso de feature-request ahora se clasifica mal. El número subió, así que habrías enviado la regresión guiándote solo por la intuición. El eval set la atrapó.
- Envía mejoras, no regresiones: demostradas, no intuidas.
- Una compuerta de CI es un chequeo automático que rechaza el cambio, sin que un humano tenga que atraparlo. Corre antes de mergear código: apúntala a tu golden dataset para que cada cambio de prompt se puntúe, y el merge se bloquee en cuanto un caso retroceda, aunque el pass-rate neto haya subido.
- Lo que sigue: exact match funciona para una sola palabra correcta, pero ¿cómo puntúas una respuesta larga y abierta donde muchas redacciones son correctas?
- El eval set que puntúas antes de lanzar es un eval offline: un conjunto fijo que corres en el laboratorio. Puede quedar obsoleto o contaminarse, las respuestas se filtran al entrenamiento, así que deja de medir la habilidad real. Los evals online vigilan el sistema en vivo en cambio: tráfico real, muestreado y puntuado de forma continua, que atrapa la deriva que un conjunto offline no ve. Y un conjunto de red-team se construye a propósito a partir de casos adversariales y de fallo, prompt injections, inputs límite, trampas conocidas, para probar las cosas que los datos normales no tocan. Los buenos equipos corren los tres: offline para frenar cambios, online para vigilar producción, red-team para sondear el peor caso.
- Tu eval offline lleva meses puntuando 98% y el equipo confía en él, pero los usuarios siguen reportando fallos. ¿Qué es lo más probable que esté mal, y qué agregarías?
- El conjunto offline probablemente quedó obsoleto o se filtró al entrenamiento, así que ya no refleja el uso real. Agrega un eval online que muestree y puntúe el tráfico en vivo, y un conjunto de red-team con los casos de fallo que los usuarios están encontrando. Un 98% congelado puede ocultar la deriva; las señales de producción y adversariales atrapan lo que un conjunto fijo no puede.
- En términos simples: ningún humano tiene que atrapar la regresión, la compuerta rechaza el cambio por sí sola.
La idea clave
Las evals convierten las 'sensaciones' en un número que puedes defender y una compuerta que puedes poner en CI.
Qué puedes hacer después de esta lección
Puedes explicar el desarrollo guiado por evals: conjuntos de prueba, puntuación y detección de regresiones.
Ponte a prueba: ¿Para qué sirve un conjunto de evals?
- Puntuar los cambios contra casos conocidos para detectar regresiones(correcta)
- Hacer que el modelo corra más rápido
- Etiquetar el tráfico de producción
- Cachear el prompt
Un set de evals puntúa cada cambio contra casos conocidos, así un ajuste que ayuda a un prompt pero rompe en silencio otros cinco se detecta antes de lanzarlo.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Evals de LLM
Adónde lleva: Pero ¿quién califica miles de respuestas abiertas? A menudo, otro modelo.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.