Saltar al contenido
todas las lecciones
Sustrato físicoS.2Bloqueada

Por qué el entrenamiento necesita centros de datos

Un modelo de frontera no cabe en una sola GPU y necesita un cómputo enorme.

La idea que hay dentro

Corta el modelo en porciones, una por GPU, y conéctalas para que actúen como una sola máquina.

Después de esta lección

Puedes explicar por qué el entrenamiento de frontera necesita centros de datos: los modelos se reparten entre muchas GPUs.

Adónde lleva

El centro de datos lo entrenó una vez. Pero la mayor parte del cómputo de IA ahora se va en responder, así que ¿cuánto cuesta una respuesta?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Corta el modelo en porciones, una por GPU, y conéctalas para que actúen como una sola máquina.

La pregunta con la que abre

Un modelo de frontera no cabe en una sola GPU y necesita un cómputo enorme.

El recorrido, en palabras de la propia lección

  • Modelo de 280 GB, chip de 80 GB. Toca el modelo para cortarlo en porciones hasta que quepa.
  • Aquí está la solución, resuelta: divide el modelo para que cada porción quepa.
  • Ahora conduces tú. Añade GPUs hasta que cada porción quepa.
  • La escala es un problema físico: memoria, cableado y watts.
  • Correcto. Cortado en 4 porciones, una por GPU, luego conectadas para que actúen como una sola máquina. Así se entrena cada modelo de frontera.
  • Aún se desborda. Cada porción supera los 80 GB, sigue cortando, una pieza más por GPU, hasta que cada porción quepa.
  • Números redondos: 280 GB son solo los pesos, 140 mil millones de parámetros a dos bytes cada uno. 80 GB es un chip clase H100, la GPU de batalla de 2023-2025. Los chips más nuevos guardan más, pero los modelos de frontera siguen superando a cualquier chip solo.
  • ¿Por qué no esperar un chip más grande, o encoger el modelo?
  • Ningún chip es ni de lejos suficientemente grande, y los modelos crecen más rápido que la memoria, así que esperar no ayuda. Encoger (quantization, 4.6) es un truco para servir; el entrenamiento ya hace gran parte de su matemática en baja precisión (BF16/FP8) y aun así necesita espacio extra, los pesos más los gradientes más el estado del optimizador, varias veces la copia que servirías. Los modelos más grandes aprenden mejor (las scaling laws de 4.4), así que un modelo de frontera debe ser así de grande mientras todavía aprende, y la única solución es repartirlo en porciones entre las GPUs.
  • 280 GB ÷ 4 GPUs = 70 GB cada una, que cabe en 80. Así que dividimos el modelo en 4 porciones, una por GPU. Ahora pruébalo tú.
  • Repartidos entre GPUs y enlazados por NVLink, los chips trabajan al unísono como una sola máquina gigante.
  • Cifras honestas: el rack GB200 NVL72 de NVIDIA enlaza 72 GPUs; los entrenamientos de frontera abarcan decenas de miles repartidas en muchos racks durante semanas.
  • Cuando el entrenamiento termina, el trabajo principal del datacenter pasa a ser servir respuestas, correr el modelo terminado para millones de usuarios. En 2026, alrededor de dos tercios de todo el cómputo de IA se va en ese trabajo de servir (llamado inference), no en entrenar.
  • Por eso la capacidad, el batching (agrupar las peticiones de mucha gente en una sola pasada por los pesos) y la velocidad moldean cada producto de IA que usas.
  • Racks como estos consumen muchísima energía. Los datacenters ya usan cerca del 2% de la electricidad del mundo, la IA es más o menos un tercio de eso y la tajada que más rápido crece, y en 2026 las empresas muchas veces pueden comprar chips más rápido de lo que la red eléctrica puede alimentarlos.
  • Así que el problema físico no es solo memoria y cableado: los nuevos datacenters de IA se planean alrededor de plantas de energía y conexiones a la red tanto como alrededor de las GPUs.
  • Los titulares dicen que entrenar un modelo de frontera requiere un datacenter entero y decenas de miles de GPUs. ¿Por qué no puede correr en una sola máquina muy potente?
  • El modelo es mucho más grande que la memoria de cualquier chip, así que hay que repartirlo entre muchas GPUs y enlazarlas con cables rápidos para que actúen como una sola. La escala es un problema físico de memoria, cableado y watts, y por eso hace falta un datacenter, no solo una computadora más rápida.

La idea clave

La escala es un problema físico, no solo matemático.

Qué puedes hacer después de esta lección

Puedes explicar por qué el entrenamiento de frontera necesita centros de datos: los modelos se reparten entre muchas GPUs.

Adónde lleva: El centro de datos lo entrenó una vez. Pero la mayor parte del cómputo de IA ahora se va en responder, así que ¿cuánto cuesta una respuesta?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.