Saltar al contenido
todas las lecciones
Salas electivasE.21Bloqueada

Video y modelos de mundo

El video hecho con IA se ve real durante dos segundos, y luego a una mano le crece un dedo y el café se rellena solo. ¿Por qué se sostiene y después se descompone?

La idea que hay dentro

El video es el mismo truco de quitar ruido aplicado a patches de espacio y tiempo, así que la consistencia se aprende, nunca se impone. Un modelo de mundo va más lejos: predice el siguiente estado de un mundo condicionado a tus acciones, no la siguiente palabra.

Después de esta lección

Puedes explicar cómo se genera el video con IA (quitando ruido a patches de espacio-tiempo), por qué se descompone, y qué es un modelo de mundo: un predictor del siguiente estado condicionado a acciones, por eso le importa a la robótica.

Adónde lleva

Vuelve a alejarte hasta el mapa de modelos de 2026: ahora puedes nombrar el truco detrás de cada familia.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

El video es el mismo truco de quitar ruido aplicado a patches de espacio y tiempo, así que la consistencia se aprende, nunca se impone. Un modelo de mundo va más lejos: predice el siguiente estado de un mundo condicionado a tus acciones, no la siguiente palabra.

La pregunta con la que abre

El video hecho con IA se ve real durante dos segundos, y luego a una mano le crece un dedo y el café se rellena solo. ¿Por qué se sostiene y después se descompone?

El recorrido, en palabras de la propia lección

  • Baja el ruido. Mira cómo los cuatro cuadros se resuelven a la vez.
  • Recorre el clip. ¿Qué cuadro descompone el objeto?
  • Elige una acción. El world model predice el siguiente estado.
  • Qué cambió cuando las acciones, no las palabras, guiaron la predicción.
  • Un clip de juguete. Un modelo de video real quita ruido a decenas de miles de bloquecitos de píxeles, no a un puñado de puntos.
  • Un solo quitador de ruido, aplicado a todos los cuadros a la vez. Eso es el video con IA.
  • Con ruido al máximo es estática. Sácale el ruido.
  • Este es el truco de quitar ruido de la lección anterior, aplicado sobre bloquecitos de píxeles que además abarcan unos cuantos cuadros. A esos bloques se les llama parches de espacio-tiempo. Cada cuadro camina del ruido a una imagen, y el modelo se entrenó para que los cuadros coincidan. Nada fuera del modelo los obliga.
  • Una sola imagen se corta en pequeños parches cuadrados. Un clip añade un eje de tiempo, así que un parche es un bloquecito de píxeles que además abarca unos cuantos cuadros. El modelo les quita el ruido a todos esos parches a la vez, y por eso los cuadros se mueven como uno solo en vez de parpadear cada uno por su lado.
  • Has visto estos clips de Sora o Veo: perfectos por dos segundos, y luego la física falla.
  • El clip se ve fluido. ¿Qué cuadro rompe la mano sin que lo notes?
  • Para el cuadro 4 a la mano le salió un sexto dedo. Ninguna regla del modelo dice que una mano conserva cinco dedos, ni que una taza que se vació sigue vacía. La consistencia es solo lo que aprendió a imitar, así que con suficientes cuadros se va desviando.
  • El modelo no trae ninguna idea de qué es una mano, una taza, ni una regla de que los objetos persisten. Solo predice parches que se parecen a sus clips de entrenamiento. Los clips cortos se desvían poco porque los clips de entrenamiento eran consistentes; mientras más corre, más se acumulan los errores pequeños.
  • Un modelo de texto predice la siguiente palabra. Un world model predice el siguiente estado de un mundo, dada tu acción.
  • Un mundo de juguete con tres acciones. Un world model real predice imágenes completas o escenas 3D, un paso por delante de tu control.
  • Llegaste a la moneda eligiendo acciones, y el modelo predijo dónde cae cada una. Una predicción dirigible como esta es lo que necesitan los robots y los motores de juego: prueba una acción en tu cabeza, mira el resultado y luego actúa de verdad.
  • La predicción se movió porque TÚ elegiste la acción, no porque hubiera una frase antes. Ese condicionamiento por acción es toda la diferencia con un modelo de texto.
  • Un robot necesita imaginar qué pasa si mueve un brazo antes de moverlo. Un world model le deja ensayar una acción y ver el siguiente estado predicho, para poder planear y evitar un error en el mundo real. La misma idea impulsa mundos de juego generados y jugables.
  • Descubriste por qué el video se desvía (nada obliga a que los objetos permanezcan entre cuadros) y viste qué cambia cuando las acciones, no las palabras, guían la predicción.
  • El video con IA entiende los objetos y la física, así que los mantiene consistentes.
  • Quita ruido a parches de espacio-tiempo para imitar clips reales. La consistencia se aprende, no se impone, así que se desvía. Un world model añade condicionamiento por acción: predice el siguiente estado según lo que haces.
  • Un clip de demo de alguien haciendo malabares se ve perfecto por dos segundos, y luego una pelota desaparece y una mano se deforma. Con esta lección, explica por qué, y qué añadiría un world model.
  • El video son parches de espacio y tiempo sin ruido entrenados para parecerse a clips reales, pero nada en el modelo obliga a que una pelota siga existiendo ni a que una mano conserve cinco dedos, así que los errores pequeños se acumulan y se desvía. Un world model iría más lejos y predeciría el siguiente estado condicionado a una acción, para que pudieras dirigir la escena y ensayar qué pasa después, y por eso la robótica y los mundos interactivos dependen de él.
  • Aleja la vista de nuevo al mapa de modelos de 2026, y ahora puedes nombrar el truco detrás de cada familia: predicción del siguiente token para el texto, quitar ruido para imágenes y video, y predicción del siguiente estado condicionada a la acción para los mundos.
  • Estado inicial. Elige una acción para ver el siguiente estado predicho.

La idea clave

Descubriste por qué el video se descompone, ninguna regla mantiene los objetos coherentes entre frames, y viste qué cambia cuando las acciones, no las palabras, dirigen la predicción.

Qué puedes hacer después de esta lección

Puedes explicar cómo se genera el video con IA (quitando ruido a patches de espacio-tiempo), por qué se descompone, y qué es un modelo de mundo: un predictor del siguiente estado condicionado a acciones, por eso le importa a la robótica.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Video y world models

Adónde lleva: Vuelve a alejarte hasta el mapa de modelos de 2026: ahora puedes nombrar el truco detrás de cada familia.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.