Difusión: imágenes desde el ruido
Escribes una frase y recibes una foto que nunca existió. Predecir la siguiente palabra no explica nada de eso, así que ¿de dónde salió la imagen?
La idea que hay dentro
El modelo parte de puro ruido y quita un poco en cada paso; fue entrenado para quitar ruido, y tu prompt, embebido en el mismo espacio que ya conoces, dirige cada paso hacia una imagen que encaje.
Después de esta lección
Puedes explicar cómo funcionan los generadores de imágenes, un modelo quita ruido paso a paso hasta llegar a una imagen mientras el prompt guía cada paso, y que es un mecanismo distinto de predecir el siguiente token.
Adónde lleva
Una imagen es una pasada de quitar ruido. Ahora aplica el mismo truco al tiempo: video, y mundos en los que puedes actuar.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
El modelo parte de puro ruido y quita un poco en cada paso; fue entrenado para quitar ruido, y tu prompt, embebido en el mismo espacio que ya conoces, dirige cada paso hacia una imagen que encaje.
La pregunta con la que abre
Escribes una frase y recibes una foto que nunca existió. Predecir la siguiente palabra no explica nada de eso, así que ¿de dónde salió la imagen?
El recorrido, en palabras de la propia lección
- Aparece una foto que nunca existió. ¿De dónde salió? Haz una apuesta.
- Saca el ruido arrastrando. Mira cómo una imagen sale del estático.
- Cambia el prompt. El mismo denoiser, dirigido hacia otro sujeto.
- Generar imágenes es quitar ruido aprendido, guiado por el vector de tu prompt.
- Este es el motor dentro de Midjourney, DALL-E y de cada generador de imágenes que has probado.
- Escribiste una frase y saliste con una foto. ¿Cómo la construyó el modelo?
- No la pinta. El modelo nunca coloca un píxel final tras otro; no hay pincel ni un plan de la imagen terminada.
- No la saca de ningún lado. La foto nunca existió. El modelo parte de estático aleatorio y quita ruido hasta que queda una imagen.
- Exacto. Parte de puro ruido aleatorio y quita un poco en cada paso. Fue entrenado para quitar ruido, así que lo que queda es una imagen.
- Durante el entrenamiento el modelo vio millones de imágenes reales con ruido añadido, y aprendió a predecir la versión limpia. Apúntalo a puro estático y hace lo mismo: quita lo que parece ruido, paso a paso, y lo que queda es una imagen plausible. Un estático inicial distinto da una imagen distinta, por eso la foto nunca existió antes.
- Una imagen de juguete en una cuadrícula diminuta. Un denoiser real recorre millones de píxeles en decenas de pasos, no un puñado de puntos.
- Del estático a una imagen, un paso de quitar ruido a la vez.
- A todo ruido es estático aleatorio. Saca el ruido.
- Ese es todo el truco. El modelo parte del ruido y quita un poco en cada paso, y lo que queda es una imagen. Por eso se llama modelo de difusión.
- El mismo denoiser, el mismo ruido. Tu prompt se convierte en un vector, el mismo tipo de embedding que ya conociste, y dirige cada paso hacia una imagen que le corresponde.
- Dos prompts de juguete. Un prompt real es un vector rico que empuja miles de pasos de quitar ruido, no un interruptor entre dos formas.
- El vector del prompt para un gato tira de cada paso hacia una estructura con forma de gato. Cambia el vector y el mismo denoiser aterriza en otro lado.
- Ahora el vector dice sol, así que el denoiser idéntico lleva el mismo ruido hacia un sol. El prompt es el volante, no el motor.
- En cada paso el modelo se hace dos preguntas: cómo se ve lo limpio por sí solo, y cómo se ve lo limpio dado este vector del prompt. Luego se inclina hacia la respuesta del prompt. Sube esa inclinación y la imagen se ajusta más al prompt; bájala y vuelve a la deriva hacia una imagen genérica. Esa inclinación se llama guidance.
- Viste el ruido convertirse en una imagen paso a paso, y lo dirigiste con un prompt. Generar imágenes es quitar ruido aprendido, guiado por el vector de tu prompt.
- Un generador de imágenes predice el siguiente píxel, igual que un chatbot predice la siguiente palabra.
- Es un denoiser, no un predictor del siguiente token. Parte de puro ruido y quita un poco en cada paso, y el vector de tu prompt dirige cada paso hacia una imagen que le corresponde.
- Un amigo dice que las imágenes de IA son solo el modelo eligiendo un píxel tras otro, como un autocompletar de imágenes. Con esta lección, explica qué está pasando de verdad.
- No es predicción del siguiente píxel. El modelo parte de puro ruido aleatorio y quita un poco en cada paso, porque fue entrenado para volver limpias las imágenes con ruido. Tu prompt se convierte en un vector, el mismo tipo que viste antes, y ese vector dirige cada paso de quitar ruido hacia una imagen que le corresponde, así que lo que queda es una imagen que nunca existió.
- Una imagen es un solo quitado de ruido. Ahora corre el mismo truco en el tiempo: el video es quitar ruido sobre fotogramas, y mundos en los que puedes actuar.
- Puedes explicar cómo funcionan los generadores de imágenes: un denoiser camina del ruido a una imagen mientras el prompt guía cada paso, y es un mecanismo distinto de la predicción del siguiente token.
La idea clave
Viste el ruido convertirse en una imagen paso a paso, y lo dirigiste: generar imágenes es quitar ruido de forma entrenada, guiado por el vector de tu prompt.
Qué puedes hacer después de esta lección
Puedes explicar cómo funcionan los generadores de imágenes, un modelo quita ruido paso a paso hasta llegar a una imagen mientras el prompt guía cada paso, y que es un mecanismo distinto de predecir el siguiente token.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Modelos de difusión
Adónde lleva: Una imagen es una pasada de quitar ruido. Ahora aplica el mismo truco al tiempo: video, y mundos en los que puedes actuar.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.