Explicador en lenguaje claro
La cuantización, explicada
¿Qué es la cuantización y cómo permite correr modelos grandes en hardware pequeño?
La cuantización guarda cada peso del modelo con menos bits, por ejemplo 4 en vez de 16. El modelo conserva el mismo número de pesos, pero cada uno se vuelve un número más grueso, así que el modelo entero se encoge a un cuarto de la memoria y se mueve más rápido por el hardware. Bien hecha, la pérdida de calidad es pequeña, porque los pesos no necesitaban tanta precisión. Es la razón principal de que hoy corran modelos capaces en laptops y teléfonos.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Por qué las GPUs ganan a las CPUs →Gratis, sin código, sin registro.
Y después ve más a fondo: Cuantización Bloqueada
Lo que la gente entiende mal
- La cuantización borra parámetros. La cantidad no cambia, cada número solo se guarda con menos detalle.
- Menos precisión significa proporcionalmente más tonto. Una cuantización cuidadosa a 8 o 4 bits pierde sorprendentemente poco en la mayoría de tareas.
- Es solo un truco para hardware débil. Los proveedores también cuantizan a escala, porque la memoria y el ancho de banda son el costo.
Dónde lo ves en productos reales
- Los archivos de modelos locales con etiquetas Q4 o Q8 son versiones cuantizadas del mismo modelo.
- Los asistentes que corren en el teléfono dependen de una cuantización agresiva para caber en la RAM.
- Los niveles de API baratos y rápidos suelen correr variantes cuantizadas por detrás.
Preguntas frecuentes
- ¿La cuantización empeora un modelo?
- Un poco, y normalmente menos de lo que la gente espera. Pasar de 16 bits a 8 suele ser difícil de notar, 4 bits es un intercambio real pero muchas veces aceptable, y por debajo de eso la calidad cae rápido. Compara en tu propia tarea, no en un benchmark general.
- ¿Por qué la cuantización acelera la generación?
- La generación está limitada sobre todo por mover pesos desde la memoria, no por la aritmética. Reducir a la mitad los bytes por peso reduce más o menos a la mitad ese tráfico, así que el mismo hardware produce tokens más rápido y puede alojar un modelo más grande.
- ¿Qué significa Q4 o 4-bit en el nombre de un modelo?
- El número de bits que se usa por peso. Menos bits significa un archivo más chico y menos memoria a cambio de algo de fidelidad. Las letras y números que siguen identifican el esquema concreto de cuantización, que se diferencian sobre todo en cómo tratan los pesos anormalmente grandes.
Explicadores relacionados
Más en Velocidad, costo y control
- ¿Qué es el routing de modelos, y cómo eliges qué modelo de IA usar?
- ¿Qué es la KV cache y por qué importa para la velocidad y el costo?
- ¿Qué hace de verdad el ajuste de temperatura en un modelo de IA?
- ¿Cómo funcionan de verdad los modelos de razonamiento?
- ¿Qué es el speculative decoding y por qué acelera a los modelos?
- ¿Qué es el prompt caching y cuánto ahorra de verdad?
- ¿Por qué operar IA es tan caro y qué estás pagando?
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.