Leer benchmarks con criterio
El modelo A saca 92% en la tabla de clasificación, el modelo B 89%. Entonces A es la mejor opción para ti, ¿verdad?
La idea que hay dentro
Un solo número de benchmark esconde trampas como la contaminación: la tabla de clasificación no es tu tarea.
Después de esta lección
Puedes interpretar las puntuaciones públicas de benchmarks, contaminación, saturación, capacidades irregulares, transferencia de dominio, y por qué un solo número no responde “¿es bueno para mi tarea?”.
Adónde lleva
Los benchmarks miden lo que los modelos pueden hacer, pero ¿qué no pueden hacer nunca?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Un solo número de benchmark esconde trampas como la contaminación: la tabla de clasificación no es tu tarea.
La pregunta con la que abre
El modelo A saca 92% en la tabla de clasificación, el modelo B 89%. Entonces A es la mejor opción para ti, ¿verdad?
El recorrido, en palabras de la propia lección
- Sube el deslizador de solapamiento: filtra más del test al entrenamiento del Modelo A y mira cómo su puntaje trepa por encima de B.
- Un número, cuatro trampas ocultas. Haz clic en cada chip para inspeccionar el puntaje.
- Así que antes de elegir un modelo desde un leaderboard, haz estas preguntas.
- Mismo modelo, misma habilidad: solo cambió la filtración. Sube el solapamiento y el número de A trepa por encima de B en preguntas memorizadas; bájalo hacia las nuevas, nunca vistas, y la ventaja se desploma, B va adelante. Un solo número puede estar inflado, ser ruidoso o medir una habilidad que no es la tuya. A continuación, desarma el puntaje y mira cómo “A gana” se tambalea de cuatro formas más.
- Elige un chip arriba. Cada uno es una forma real y documentada en que un solo puntaje engaña.
- Todos los porcentajes que se muestran aquí son ilustrativos, no puntajes reales de modelos, pero las cuatro trampas son fenómenos reales y documentados.
- Un leaderboard ordena modelos según sus preguntas, no las tuyas. Trata un puntaje público como un filtro para tu lista corta, nunca como la respuesta final.
- El único benchmark que mide TU tarea es el eval set que construyes para ella (lección 7.3). Arma la lista corta con puntajes públicos; decide con tus propios evals sobre tus propios datos.
- Un proveedor te vende su modelo porque encabeza por unos pocos puntos un leaderboard popular de programación. Antes de cambiarte, ¿qué deberías revisar?
- Trata ese número como un filtro para tu lista corta, no como un veredicto. Unos pocos puntos cerca del tope pueden ser ruido (saturación), las preguntas pueden haberse filtrado al entrenamiento (contaminación), y el ranking general es irregular: el líder puede ir por detrás en la habilidad y los datos concretos que necesitas. Decídelo con tu propio eval set sobre tus propios inputs.
- El Modelo A lidera, pero solo en preguntas memorizadas y filtradas.
- En preguntas nuevas la ventaja se invierte: el Modelo B va adelante.
- Todos a unos pocos puntos del techo, vuélvelo a correr y el orden puede invertirse.
- A es más alto en promedio, pero B es el que en realidad querrías.
La idea clave
Puedes leer un número de benchmark con escepticismo y hacer las preguntas que de verdad predicen si encaja.
Qué puedes hacer después de esta lección
Puedes interpretar las puntuaciones públicas de benchmarks, contaminación, saturación, capacidades irregulares, transferencia de dominio, y por qué un solo número no responde “¿es bueno para mi tarea?”.
Adónde lleva: Los benchmarks miden lo que los modelos pueden hacer, pero ¿qué no pueden hacer nunca?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.