Explicador en lenguaje claro
Por qué la IA corre en GPUs
¿Por qué las GPUs, y no las CPUs, son el hardware del boom de la IA?
Casi todo lo que hace un modelo de lenguaje es multiplicar cuadrículas enormes de números, y esos millones de pequeñas multiplicaciones no dependen unas de otras. Una CPU tiene unos pocos núcleos rápidos hechos para correr pasos uno tras otro. Una GPU tiene miles de núcleos simples hechos para aplicar la misma operación a lotes gigantes a la vez. Para la matemática de matrices, ganan los miles. Los gráficos necesitaron esa matemática primero, y por eso el chip de videojuegos se volvió el chip de la IA.
Revisado por última vez el
No te quedes en leerlo. Opera tú mismo el mecanismo en una lección interactiva corta.
Míralo funcionar: Por qué las GPUs ganan a las CPUs →Gratis, sin código, sin registro.
Lo que la gente entiende mal
- Las GPUs son simplemente computadoras más rápidas. En trabajo secuencial y con ramificaciones gana la CPU. La GPU solo gana cuando el trabajo es masivamente paralelo.
- La IA necesita GPUs por los gráficos. No hay píxeles de por medio. El ingrediente compartido es la multiplicación de matrices.
- Apilar más GPUs siempre acelera en proporción. Los chips deben intercambiar resultados, y esa comunicación se vuelve su propio cuello de botella.
Dónde lo ves en productos reales
- La escasez de GPUs y la subida de Nvidia son demanda de esta matemática paralela.
- Las nubes cobran el cómputo de IA como instancias de GPU por hora.
- Una tarjeta de videojuegos puede correr un modelo local cuantizado: mismo hardware, trabajo nuevo.
Preguntas frecuentes
- ¿Por qué una GPU es mejor que una CPU para la IA?
- El trabajo son miles de multiplicaciones y sumas idénticas sin dependencias entre ellas. Una CPU tiene unos pocos núcleos muy rápidos y muy listos. Una GPU tiene miles de núcleos más simples que hacen todos lo mismo a la vez, y la tarea encaja con la segunda forma.
- ¿El cuello de botella real es la memoria o el cómputo?
- En el entrenamiento, el cómputo. En la generación, casi siempre el ancho de banda de memoria: cada token nuevo necesita volver a leer los pesos desde la memoria mientras las unidades de cálculo esperan. Por eso el ancho de banda y la capacidad de memoria son las cifras de titular en los aceleradores de IA.
- ¿Qué es una TPU o una NPU?
- Chips construidos para la misma forma de trabajo con menos herencia de gráficos. Las TPU de Google sirven sus propios modelos, y las NPU de teléfonos y portátiles corren modelos pequeños en local. Compiten en rendimiento por vatio más que en cifras pico brutas.
Explicadores relacionados
Más en Velocidad, costo y control
- ¿Qué es el routing de modelos, y cómo eliges qué modelo de IA usar?
- ¿Qué hace de verdad el ajuste de temperatura en un modelo de IA?
- ¿Cómo funcionan de verdad los modelos de razonamiento?
- ¿Qué es el speculative decoding y por qué acelera a los modelos?
- ¿Qué es el prompt caching y cuánto ahorra de verdad?
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.