Saltar al contenido

Explicador en lenguaje claro

LLM como juez, y cuándo fiarse del veredicto

¿Qué es usar un LLM como juez y funciona?

Es usar un modelo para calificar la salida de otro modelo contra una rúbrica escrita, en vez de pagarle a una persona por leer cada respuesta. Es rápido, barato y consistente, y por eso es el estándar en casi todos los pipelines de evaluación. También hereda los puntos ciegos del juez: premia respuestas largas, seguras y bien formateadas, puede preferir texto de un modelo parecido a él, y favorece a la primera respuesta que vio. Calíbralo contra etiquetas humanas antes de confiar en él.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: LLM-as-a-judge Bloqueada

Lo que la gente entiende mal

  • Un modelo juez es objetivo. Es otro predictor con preferencias aprendidas, y esas preferencias aparecen como sesgos consistentes y medibles.
  • Una nota alta del juez significa usuarios contentos. Significa que la respuesta encajó con una rúbrica. Si la rúbrica encaja con lo que quieren los usuarios es otra pregunta que tienes que comprobar.
  • Hace falta un modelo de frontera para juzgar. Para comprobaciones estrechas, un modelo chico con una rúbrica ajustada suele igualar a uno grande por una fracción del costo.

Dónde lo ves en productos reales

  • Suites de regresión que puntúan cada actualización de modelo antes de publicarla.
  • Filtros de contenido automáticos y controles de calidad sobre la salida generada.
  • Recolección de datos de preferencia, donde un juez sustituye a los evaluadores humanos a escala.

Preguntas frecuentes

¿Qué sesgos tiene un LLM juez?
Tres que aparecen una y otra vez: preferencia por las respuestas largas, preferencia por la primera opción presentada, y una preferencia leve por el texto de un modelo parecido. Aleatorizar el orden de las respuestas y limitar el largo en la rúbrica quita casi todo el daño.
¿Cómo sé si mi juez sirve?
Califica una muestra a mano y mide cuánto coincide con el juez. Si discrepan en una quinta parte de los casos, el juez está midiendo otra cosa distinta a la que querías, y el arreglo casi siempre es una rúbrica más afilada con ejemplos concretos de cada nota.
¿El juez debería ser el mismo modelo que se evalúa?
Mejor usa otro cuando puedas. Un modelo puntuando su propia salida es el caso con el efecto de autopreferencia más fuerte, y usar un modelo distinto o una versión anterior hace la comparación más difícil de engañar.

Explicadores relacionados

Más en Construir encima, y confiar en ello

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.