Por qué las GPUs ganan a las CPUs
Cada celda de salida de una capa es su propia suma independiente, así que todas se calculan a la vez.
Llegaste al final de la muestra gratis. La siguiente lección necesita tu pase:
Pero un solo chip no puede albergar un modelo de frontera…
S.2 Por qué el entrenamiento necesita centros de datosSe apoya en3.6Qué hace en realidad una capa neuronal
Preguntas frecuentes
¿De qué trata "Por qué las GPUs ganan a las CPUs"?
¿Qué es lo complicado de esto?
¿Qué sabré hacer después de esta lección?
¿Qué viene después?
Qué muestra esta lección
Cada celda de salida de una capa es su propia suma independiente, así que todas se calculan a la vez.
La pregunta con la que abre
Una multiplicación de matrices gigante en unos pocos núcleos de CPU rápidos tarda una eternidad.
El recorrido, en palabras de la propia lección
- Las mismas 36 celdas, dos máquinas. Toca la que apostarías y luego pulsa Disparar.
- ¿Por qué una GPU puede hacer las 36 de golpe? Cada celda es su propia sumita.
- Exacto: ninguna celda necesita la respuesta de otra antes, así que la GPU hace las 36 de golpe y gana por mucho.
- Los pocos trabajadores de la CPU deben tomar las celdas por rondas. La GPU tiene muchos más, así que agarra las 36 de golpe. Aquí gana ancho.
- Cada celda usa su propia fila de pesos (lección 3.6) y nada más. Las filas no se esperan entre sí, así que todas las celdas se pueden calcular a la vez. Cada trabajador de la GPU es un poco más lento que uno de la CPU, pero hay tantos que hacer las 36 de un solo golpe igual gana.
- Como el trabajo es paralelo, gana el hardware ancho: una GPU resuelve cada celda de un solo golpe. Por eso la IA corre en GPUs.
- La atención (lección 3.2) es el mismo tipo de matemática, grandes lotes de multiplicar-y-sumar entre palabras, así que el transformer entero corre en ancho en una GPU.
- Una GPU es más rápida que una CPU, o es solo el chip de gráficos, y por eso la IA necesita una.
- Cada trabajador de una GPU es en realidad un poco más lento que un núcleo de CPU. La IA gana por ancho, no por velocidad: la matemática son miles de sumas independientes, y una GPU las hace todas a la vez en lugar de por rondas.
- Los trabajadores rápidos son solo la mitad de la historia. La fila de pesos de cada celda tiene que llegar primero desde la memoria, y con miles de trabajadores disparando a la vez, entregar los pesos se vuelve la parte lenta. A la velocidad con la que la memoria puede alimentar el chip se le llama memory bandwidth (ancho de banda de memoria).
- Por eso los chips de IA vienen envueltos en pilas de memoria especial de alta velocidad llamada HBM, y por eso en 2026 esa memoria, no solo la GPU en sí, es una de las piezas más escasas de la IA.
- Una empresa de IA dice estar “GPU-constrained” y no conseguir suficientes chips, y una sola GPU de gama alta cuesta mucho más que una CPU más rápida. ¿Por qué pagar igual por la GPU?
- La matemática de fondo son miles de pequeñas sumas independientes que no se esperan entre sí, así que los muchos trabajadores de una GPU las hacen todas a la vez mientras una CPU rápida avanza por tandas. Aquí ancho le gana a rápido, así que lo escaso son las GPUs, no las CPUs, y en 2026 a las empresas las aprieta tanto la memoria que alimenta esos chips y la energía que los hace funcionar como los chips mismos.
La idea clave
Las matemáticas de la IA son paralelas, así que gana el hardware ancho.
Qué puedes hacer después de esta lección
Puedes explicar por qué la IA corre en GPUs: el matmul es paralelo, así que gana el hardware ancho.
Ponte a prueba: ¿Por qué las GPU superan a las CPU para la IA?
- La multiplicación de matrices es paralela; las GPU tienen miles de trabajadores(correcta)
- Las GPU tienen núcleos individuales más rápidos
- Las GPU usan menos memoria
- Las GPU son más baratas
La operación central es la multiplicación de matrices, que es masivamente paralela. Las GPU corren miles de trabajadores simples a la vez, lo que le encaja perfecto.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: GPUs para IA
Adónde lleva: Pero un solo chip no puede albergar un modelo de frontera…
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.