Saltar al contenido
todas las lecciones
LLMs en producción7.4Bloqueada

LLM-as-a-judge

Tienes 10,000 respuestas abiertas que calificar. Los humanos no pueden con todas.

La idea que hay dentro

Un modelo potente califica las respuestas con una lista de criterios clara: rápido y escalable, pero ojo con sus sesgos.

Después de esta lección

Puedes explicar LLM-as-a-judge, sus sesgos y cómo hacerlo confiable.

Adónde lleva

Tanto las evals como los jueces necesitan una fuente de verdad: datos etiquetados.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Un modelo potente califica las respuestas con una lista de criterios clara: rápido y escalable, pero ojo con sus sesgos.

La pregunta con la que abre

Tienes 10,000 respuestas abiertas que calificar. Los humanos no pueden con todas.

El recorrido, en palabras de la propia lección

  • 10.000 respuestas libres, ninguna cadena correcta que comparar. Toca la guía de puntuación para calificar una. ¿Qué hace la calificación?
  • Un modelo juez puntúa cada respuesta contra una guía de puntuación y elige un ganador en A-vs-B.
  • La Respuesta B es genuinamente mejor. Cambia el orden de lectura: ¿cuál es el veredicto del juez? Adivina primero.
  • Apila las mitigaciones y mira cómo sube la concordancia con los humanos.
  • Un modelo puede calificar a escala, si controlas su sesgo y lo contrastas con humanos.
  • El calificador es en sí mismo un modelo fuerte: dale la pregunta, la respuesta y una guía de puntuación, y devuelve una puntuación en segundos, por centavos. Eso es LLM-as-a-judge: sin coincidencia de texto, sin panel humano.
  • Pointwise puntúa una respuesta contra una guía de puntuación; pairwise le da al juez dos y le pregunta cuál es mejor: suele ser más fiable que las puntuaciones absolutas.
  • Esta guía de puntuación es reference-free: no necesita respuesta de oro, solo criterios. Si la comparas con una respuesta de referencia, es reference-based.
  • En orden A-y-luego-B el juez elige A, la peor. Cambia a B-y-luego-A: ¿cuál es su veredicto?
  • Eso es el sesgo de posición, el juez simplemente elige lo que lee primero. Es uno de tres que aparecen una y otra vez:
  • No necesitas etiquetar las 10.000: unas pocas docenas de ítems calificados por humanos bastan para verificar y ajustar el juez.
  • Orden promediado, un calificador fuerte, guía de puntuación calibrada con etiquetas humanas: el juez ahora coincide con los humanos ~9 de cada 10 veces. Ese es un juez que puedes poner detrás de tu eval.
  • Calificación escalable, pero solo cuando la has contrastado con el ground truth, que es justo de lo que trata la próxima lección: datos etiquetados.
  • Un equipo califica automáticamente sus respuestas de soporte con un LLM-as-a-judge, y las respuestas más largas y evasivas siempre ganan. ¿Por qué, y qué arreglarías?
  • Sesgo de verbosidad: el juez premia la longitud y la minuciosidad aparente por encima de si la respuesta de verdad resuelve el problema. Usa una guía de puntuación más afilada que puntúe la resolución en vez de la longitud, y calibra el juez contra unas pocas docenas de ítems calificados por humanos para que sus puntuaciones sigan el ground truth en lugar del número de palabras.
  • Toca «Completa» para cubrir el caso límite y mira cómo se recalcula la puntuación.
  • El juez devuelve un veredicto, pero ¿con qué base? ¿La calidad, o solo el orden de lectura? El siguiente paso lo pone a prueba.
  • Medida contra un conjunto reservado de respuestas calificadas por humanos: tu ground truth.
  • Números de concordancia inventados; la dirección es real (cada arreglo ayuda), los puntos exactos no están medidos.

La idea clave

Un modelo puede calificar a escala, si controlas sus sesgos y lo contrastas con humanos.

Qué puedes hacer después de esta lección

Puedes explicar LLM-as-a-judge, sus sesgos y cómo hacerlo confiable.

Ponte a prueba: Un riesgo clave de usar un LLM para calificar salidas es…
  • Sesgo (posición, verbosidad, autopreferencia), calíbralo contra humanos(correcta)
  • Siempre es más lento que los humanos
  • No puede comparar dos respuestas
  • No necesita ninguna guía de puntuación

Los modelos que califican arrastran sesgos (favorecer la primera opción, las respuestas largas, su propio estilo). Calíbralos contra etiquetas humanas antes de fiarte de las notas.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: LLM como juez

Adónde lleva: Tanto las evals como los jueces necesitan una fuente de verdad: datos etiquetados.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.