Curación de los datos de entrenamiento
¿Qué entra realmente en el conjunto de entrenamiento?
La idea que hay dentro
Conduce un embudo: web en bruto → deduplicación → filtro de calidad → descontaminación.
Después de esta lección
Puedes explicar cómo se limpian los datos de entrenamiento, y por qué la calidad gana a la cantidad.
Adónde lleva
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Conduce un embudo: web en bruto → deduplicación → filtro de calidad → descontaminación.
La pregunta con la que abre
¿Qué entra realmente en el conjunto de entrenamiento?
El recorrido, en palabras de la propia lección
- La web es sobre todo basura. Arrastra el control de limpieza y observa qué pocos sobreviven.
- Un recorrido guiado. Observa cómo el corpus se encoge, etapa por etapa.
- Ahora tú manejas el embudo. Arrastra por las cuatro etapas.
- Una cuarta parte del tamaño, y mucho más limpio. La calidad gana a la cantidad.
- Solo sobrevive una cuarta parte. Tres de cada cuatro páginas son basura.
- Sigue arrastrando. Cada filtro descarta más, hasta que apenas queda una cuarta parte.
- Cifras y puntuaciones de calidad ilustrativas, las proporciones reales de filtrado varían según el pipeline.
- 100 → 25: una cuarta parte del tamaño, mucho más limpio. La calidad gana a la cantidad.
- Un modelo aprende exactamente de lo que se le da. Los duplicados gastan entrenamiento en la misma página dos veces; el spam y el galimatías le enseñan a escribir spam y galimatías; las preguntas de examen coladas le dejan memorizar respuestas en vez de aprender. Así que un montón más pequeño y limpio enseña más que uno más grande y sucio.
- Un equipo ajusta un modelo con todos los tickets de soporte que tiene, en crudo, y empeora en vez de mejorar. ¿Qué salió mal?
- Un modelo aprende exactamente de lo que le das, así que tickets en crudo llenos de duplicados, basura y ruido le enseñan duplicados, basura y ruido. Deduplica, filtra por calidad y quita primero todo lo que se solape con tu set de prueba: un montón pequeño y limpio gana a uno grande y sucio.
La idea clave
El corpus se encoge y la 'calidad' sube.
Qué puedes hacer después de esta lección
Puedes explicar cómo se limpian los datos de entrenamiento, y por qué la calidad gana a la cantidad.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.