Saltar al contenido

Explicador en lenguaje claro

Difusión, o cómo aparece una imagen desde el ruido

¿Cómo funcionan de verdad los generadores de imágenes con IA?

Un modelo de difusión se entrena tomando imágenes reales, agregándoles ruido hasta que son estática y aprendiendo a deshacer un paso de ese ruido. Para generar, parte de ruido puro y ejecuta muchas veces ese paso aprendido, empujando cada vez la imagen hacia algo más parecido a una foto. Tu prompt guía cada paso, así que el ruido se resuelve en una imagen que encaja con la descripción. No se copia ni se recupera nada. La imagen se quita del ruido hasta existir.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: Difusión: imágenes desde el ruido Bloqueada

Lo que la gente entiende mal

  • Pega trozos de imágenes que ha visto. Guarda patrones aprendidos en pesos, no una biblioteca de imágenes fuente de la que recortar.
  • Dibuja como una persona, empezando por el contorno. Refina todo el lienzo a la vez, decenas de veces, del borrón al detalle.
  • Más pasos siempre da mejor imagen. Pasado cierto punto los pasos extra cambian muy poco y solo cuestan tiempo.

Dónde lo ves en productos reales

  • Generadores de imágenes como Midjourney, DALL-E y Stable Diffusion.
  • El relleno generativo y el borrado de objetos en los editores de fotos.
  • Bocetos de producto y de marketing hechos a partir de un texto.

Preguntas frecuentes

¿Cómo controla la imagen el texto del prompt?
El prompt se convierte en un embedding con un codificador de texto, y ese embedding condiciona cada paso de limpieza. Las palabras importan porque mueven ese vector, y por eso un sinónimo puede cambiar el resultado más de lo que esperas.
¿Por qué las manos y el texto generados todavía salen mal?
Las dos cosas necesitan una estructura exacta y contable, y el modelo optimiza lo que parece estadísticamente verosímil, no lo que es estructuralmente correcto. Los resultados mejoraron mucho a medida que los modelos ganaron consistencia global, y siguen siendo donde los errores aparecen primero.
¿La difusión tiene que ver con cómo funciona ChatGPT?
Comparten la maquinaria transformer y la idea de aprender una distribución, y se diferencian en el bucle. Un modelo de lenguaje predice el siguiente token de una secuencia. Un modelo de difusión refina una imagen entera en pasadas repetidas. Algunos sistemas nuevos difuminan esa frontera usando difusión para texto o transformers dentro del limpiador de ruido.

Explicadores relacionados

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.