Saltar al contenido
todas las lecciones
LLMs en producción7.5Bloqueada

Datasets, etiquetado y ground truth

Tu eval vale lo que valen sus respuestas. ¿De dónde sale 'la respuesta correcta'?

La idea que hay dentro

El ground truth lo construyen personas: pautas claras, anotadores y conjuntos de referencia bien curados.

Después de esta lección

Puedes explicar cómo se construyen los datasets etiquetados y el ground truth, y por qué la calidad de las etiquetas es crítica.

Adónde lleva

Y esos datos no se quedan quietos, producción los convierte en un volante de inercia.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

El ground truth lo construyen personas: pautas claras, anotadores y conjuntos de referencia bien curados.

La pregunta con la que abre

Tu eval vale lo que valen sus respuestas. ¿De dónde sale 'la respuesta correcta'?

El recorrido, en palabras de la propia lección

  • Estás en la silla de quien etiqueta. Lee este ticket y clasifícalo, luego revela qué eligieron los demás.
  • Ahora tú eres quien etiqueta. Clasifica cada ticket y luego revela qué eligieron los demás.
  • Sube una guía clara y mira cómo cada ticket se decide por una sola respuesta, que puede contradecir a la mayoría.
  • La calidad gana a la cantidad: una IA confiable se apoya en etiquetas confiables.
  • Cada eval califica contra una 'respuesta correcta.' Antes de preguntar de dónde sale, prueba a producir una tú.
  • Fíjate: gente razonable se divide en este ticket. La 'respuesta correcta' no está en los datos; la deciden las personas al etiquetar, un juicio a la vez. A continuación: haz unos cuantos más.
  • En cada ticket dos eligen una etiqueta y uno elige otra. Un acuerdo bajo no significa que quienes etiquetan sean perezosos; significa que nadie les dijo cómo manejar los casos difíciles. Lo que lo eleva es una guía clara.
  • Panel de juguete con 3 etiquetadores; los porcentajes muestran la tendencia, no un estudio medido.
  • Una guía es el reglamento escrito: 'un problema de dinero mezclado con cualquier otra cosa → Facturación.' Los casos límite reciben una decisión, así quienes etiquetan dejan de adivinar.
  • Un modelo redacta cada etiqueta en segundos, pero una persona aún verifica cada una. La máquina te ahorra teclear, no el criterio.
  • No. Sin importar cómo se redacten las etiquetas, la regla no cambia: la máquina propone, una persona la confirma o corrige antes de que cuente como gold.
  • Los modelos pueden pre-etiquetar, pero los humanos verifican. Diez mil etiquetas descuidadas pierden frente a cien limpias, porque todo lo que se construye sobre ellas, cada eval, cada juez, cada modelo entrenado con ellas, hereda su calidad. Una IA confiable se apoya en etiquetas confiables.
  • Tu equipo armó un eval set rápido haciendo que tres contratistas etiquetaran tickets sin un reglamento común, y los puntajes parecen azar. ¿Qué salió mal?
  • Sin una guía clara, quienes etiquetan no se ponen de acuerdo en los casos ambiguos, así que la concordancia entre anotadores es baja y la «respuesta correcta» es endeble. Escribe una guía que decida los casos límite, haz que varios anotadores arbitren hacia un gold set, y deja que un modelo pre-etiquete solo si un humano verifica cada uno.

La idea clave

La IA confiable se apoya en etiquetas confiables; el buen trabajo de datos es el cimiento oculto.

Qué puedes hacer después de esta lección

Puedes explicar cómo se construyen los datasets etiquetados y el ground truth, y por qué la calidad de las etiquetas es crítica.

Ponte a prueba: ¿De dónde sale el 'ground truth' de una eval?
  • Personas etiquetando datos con guías claras, verificado, no adivinado(correcta)
  • El propio puntaje de confianza del modelo
  • El dataset que sea más grande
  • Un muestreo aleatorio de la web

La verdad de referencia la construyen personas etiquetando datos con guías claras, y luego se verifica. No es la confianza del propio modelo ni el dataset más grande.

Adónde lleva: Y esos datos no se quedan quietos, producción los convierte en un volante de inercia.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.