Saltar al contenido
todas las lecciones
Salas electivasE.5Bloqueada

Curación de los datos de entrenamiento

¿Qué entra realmente en el conjunto de entrenamiento?

La idea que hay dentro

Conduce un embudo: web en bruto → deduplicación → filtro de calidad → descontaminación.

Después de esta lección

Puedes explicar cómo se limpian los datos de entrenamiento, y por qué la calidad gana a la cantidad.

Adónde lleva

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Conduce un embudo: web en bruto → deduplicación → filtro de calidad → descontaminación.

La pregunta con la que abre

¿Qué entra realmente en el conjunto de entrenamiento?

El recorrido, en palabras de la propia lección

  • La web es sobre todo basura. Arrastra el control de limpieza y observa qué pocos sobreviven.
  • Un recorrido guiado. Observa cómo el corpus se encoge, etapa por etapa.
  • Ahora tú manejas el embudo. Arrastra por las cuatro etapas.
  • Una cuarta parte del tamaño, y mucho más limpio. La calidad gana a la cantidad.
  • Solo sobrevive una cuarta parte. Tres de cada cuatro páginas son basura.
  • Sigue arrastrando. Cada filtro descarta más, hasta que apenas queda una cuarta parte.
  • Cifras y puntuaciones de calidad ilustrativas, las proporciones reales de filtrado varían según el pipeline.
  • 100 → 25: una cuarta parte del tamaño, mucho más limpio. La calidad gana a la cantidad.
  • Un modelo aprende exactamente de lo que se le da. Los duplicados gastan entrenamiento en la misma página dos veces; el spam y el galimatías le enseñan a escribir spam y galimatías; las preguntas de examen coladas le dejan memorizar respuestas en vez de aprender. Así que un montón más pequeño y limpio enseña más que uno más grande y sucio.
  • Un equipo ajusta un modelo con todos los tickets de soporte que tiene, en crudo, y empeora en vez de mejorar. ¿Qué salió mal?
  • Un modelo aprende exactamente de lo que le das, así que tickets en crudo llenos de duplicados, basura y ruido le enseñan duplicados, basura y ruido. Deduplica, filtra por calidad y quita primero todo lo que se solape con tu set de prueba: un montón pequeño y limpio gana a uno grande y sucio.

La idea clave

El corpus se encoge y la 'calidad' sube.

Qué puedes hacer después de esta lección

Puedes explicar cómo se limpian los datos de entrenamiento, y por qué la calidad gana a la cantidad.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.