Saltar al contenido

Explicador en lenguaje claro

Los evals de LLM, explicados

¿Qué son los evals, y cómo saben los equipos que una función de IA funciona?

Un eval es una prueba repetible para una función de IA: un conjunto de entradas y una forma de puntuar si las salidas son lo bastante buenas. Como los modelos no son deterministas y 'se ve bien' no escala, los equipos construyen evals para atrapar regresiones antes que los usuarios. La puntuación puede ser comprobaciones exactas, rúbricas u otro modelo que actúa como juez. Lo difícil es mantener los evals honestos: un conjunto offline congelado puede quedar obsoleto o filtrarse al entrenamiento, así que las pruebas en producción y adversariales atrapan el resto.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: Evals: demostrar que funciona Bloqueada

Lo que la gente entiende mal

  • Una puntuación offline alta significa que es seguro lanzar. El conjunto puede estar obsoleto o contaminado; vigila también el tráfico real.
  • Los evals son solo tests unitarios. Puntúan calidad difusa, a menudo con rúbricas o un modelo juez, no igualdad exacta.
  • Un modelo juez es imparcial. Los jueces tienen sesgos y necesitan calibrarse contra valoraciones humanas.

Dónde lo ves en productos reales

  • Los equipos condicionan los lanzamientos a una suite de evals, como los tests en CI.
  • Los evals online puntúan una muestra del tráfico real tras el lanzamiento.
  • Los evals de red-team buscan fallos y prompt injection antes de que los encuentren los usuarios.

Preguntas frecuentes

¿Por qué no usar simplemente benchmarks públicos?
Miden capacidad general en tareas que no son las tuyas, y los populares se van filtrando con el tiempo a los datos de entrenamiento. Un conjunto pequeño de ejemplos reales tuyos con respuestas correctas conocidas te dice más sobre tu producto que cualquier ranking.
¿Cuántos casos de prueba necesito para empezar?
Veinte reales le ganan a ninguno, y le ganan a doscientos inventados. Sácalos del tráfico real, incluidos los fallos que te molestaron, y suma un caso cada vez que algo se rompa en producción.
¿Qué se mide en realidad?
Aquello cuyo fallo dolería. Coincidencia exacta donde hay una respuesta correcta, una regla verificada donde importa el formato, una puntuación con rúbrica donde la calidad es un juicio. Elige la comprobación más barata que habría atrapado tu último error real.

Explicadores relacionados

Más en Construir encima, y confiar en ello

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.