Copyright y procedencia: ¿con qué datos se entrenó esto?
Un modelo puede escribir al estilo de un novelista o soltar código que claramente aprendió en algún sitio. ¿De dónde salieron todos esos datos de entrenamiento, y quién tiene permitido usarlos?
La idea que hay dentro
Los datos de entrenamiento tienen procedencia: algunos tienen licencia abierta, otros necesitan permiso, otros están en disputa. Público no es lo mismo que permitido, y de quién es la salida de la IA sigue sin estar claro.
Después de esta lección
Puedes razonar sobre de dónde vienen los datos de entrenamiento y las preguntas de copyright, consentimiento y propiedad que plantean, sin confundir 'público' con 'permitido'.
Adónde lleva
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Los datos de entrenamiento tienen procedencia: algunos tienen licencia abierta, otros necesitan permiso, otros están en disputa. Público no es lo mismo que permitido, y de quién es la salida de la IA sigue sin estar claro.
La pregunta con la que abre
Un modelo puede escribir al estilo de un novelista o soltar código que claramente aprendió en algún sitio. ¿De dónde salieron todos esos datos de entrenamiento, y quién tiene permitido usarlos?
El recorrido, en palabras de la propia lección
- Clasifica cada fuente: ¿es libre para entrenar, necesita licencia, o está vedada o en disputa?
- Ahora el otro lado: ¿qué pasa con las palabras que el modelo devuelve?
- Público no es lo mismo que permitido, y de quién es la salida no está claro.
- Los mismos datos, reglas muy distintas. La procedencia, de dónde vino y bajo qué licencia, decide qué es justo para entrenar. 'Estaba en internet' no es una licencia.
- Ilustrativo de cómo se razona la procedencia, no es asesoría legal.
- Un modelo entrenado con texto con copyright. ¿Puede alguna vez reproducir un pasaje casi palabra por palabra en su salida?
- Los modelos grandes pueden memorizar texto que vieron mucho o que era raro y distintivo, y repetirlo. Así que la pregunta del copyright cae también en la salida, no solo en el conjunto de entrenamiento.
- Del lado de la entrada: licenciar datos, filtrar el contenido con copyright conocido y el privado, y guardar registros de procedencia. Del lado de la salida: filtros que atrapan la repetición literal, y credenciales de contenido (como C2PA) que etiquetan los medios generados por IA para poder rastrearlos. Nada de esto resuelve del todo de quién es qué, por eso los proveedores ofrecen cada vez más indemnización por copyright como respuesta de negocio a una zona gris legal.
- Los reguladores también están entrando: en la UE, quienes hacen modelos de propósito general (GPAI, los modelos detrás de los chatbots) deben publicar un resumen de sus datos de entrenamiento y respetar los opt-outs de los titulares de derechos bajo el EU AI Act.
- Si está en internet público es libre para entrenar, y lo que sea que la IA produzca es tuyo automáticamente para usar.
- Público no es permiso: la procedencia y la licencia deciden qué es justo para entrenar, y la propiedad de la salida de la IA no está clara y varía según el país.
- Un proveedor anuncia que su modelo está 'entrenado solo con datos licenciados' y te ofrece indemnización por copyright (el proveedor promete pagar si te demandan por los datos de entrenamiento). ¿Qué riesgo está atacando en realidad?
- El riesgo de procedencia. Si un modelo se entrenó con datos con copyright o pirateados, sus salidas podrían exponerte a reclamos por infracción. 'Datos licenciados' e indemnización son cómo un proveedor te quita esa exposición legal de encima, lo que te dice que la exposición es real.
- Puedes razonar sobre de dónde vienen los datos de entrenamiento y las preguntas de copyright, consentimiento y propiedad que plantean, sin confundir 'público' con 'permitido'.
- Esta lección explica el panorama. No es asesoría legal.
La idea clave
Ordenaste fuentes de datos reales según si un modelo puede entrenar con ellas libremente, y viste por qué 'estaba en internet' no es una licencia.
Qué puedes hacer después de esta lección
Puedes razonar sobre de dónde vienen los datos de entrenamiento y las preguntas de copyright, consentimiento y propiedad que plantean, sin confundir 'público' con 'permitido'.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.