La sala de evals: ¿se lanza?
El eval offline marca 98% y el equipo confía en él, pero los usuarios siguen topándose con fallos. ¿Lanzas la siguiente versión o no?
La idea que hay dentro
Una puntuación offline alta puede estar obsoleta o contaminada, así que no basta por sí sola. La evidencia online sobre datos frescos, un red-team y el riesgo de la función son lo que de verdad decide si se lanza.
Después de esta lección
Puedes decidir si lanzar una función de IA con evidencia imperfecta: sopesar evals offline vs online, la frescura del conjunto de evals, los resultados de red-team, la latencia y el riesgo de la función, en lugar de confiar en un solo número.
Adónde lleva
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Una puntuación offline alta puede estar obsoleta o contaminada, así que no basta por sí sola. La evidencia online sobre datos frescos, un red-team y el riesgo de la función son lo que de verdad decide si se lanza.
La pregunta con la que abre
El eval offline marca 98% y el equipo confía en él, pero los usuarios siguen topándose con fallos. ¿Lanzas la siguiente versión o no?
El recorrido, en palabras de la propia lección
- Buena decisión. Trae la siguiente versión al banco.
- Hay una versión en el banco. Lee las señales y toma la decisión.
- Trabaja el banco: acierta la decisión en al menos 2 de las 3 versiones.
- Una puntuación offline alta nunca basta por sí sola. Lo deciden el online, el red-team y el riesgo.
- No puedes leer el veredicto de un solo número. Un eval offline congelado puede estar obsoleto o contaminado; la evidencia online sobre datos frescos, un red-team y el riesgo de la función son lo que te dice si lanzar.
- El equipo quiere lanzar porque un número de un leaderboard público subió esta semana. ¿Qué compruebas antes de aceptar?
- Si TU conjunto de evals, construido con casos reales de tus usuarios, se movió. Un leaderboard califica las preguntas de otros, no las de tus usuarios. Luego comprueba que la latencia y el costo se mantuvieron, y corre el modelo nuevo en sombra junto al sistema real antes de que tome el control. Los benchmarks públicos no son tus usuarios.
La idea clave
Tomaste la decisión de lanzar en tres versiones con evidencia imperfecta, y viste por qué un 98% congelado es una prueba más débil que los resultados en vivo y un red-team limpio.
Qué puedes hacer después de esta lección
Puedes decidir si lanzar una función de IA con evidencia imperfecta: sopesar evals offline vs online, la frescura del conjunto de evals, los resultados de red-team, la latencia y el riesgo de la función, en lugar de confiar en un solo número.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.