Saltar al contenido
todas las lecciones
Operación y escalado4.6Bloqueada

Cuantización

El modelo es demasiado grande para caber / servirse.

La idea que hay dentro

Almacena los pesos con menor precisión; pequeño coste de exactitud, gran ahorro de memoria.

Después de esta lección

Puedes explicar la cuantización: menos bits por peso, gran ahorro de memoria, pequeño coste de calidad.

Adónde lleva

¿Hasta dónde se ha escalado esta misma máquina?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Almacena los pesos con menor precisión; pequeño coste de exactitud, gran ahorro de memoria.

La pregunta con la que abre

El modelo es demasiado grande para caber / servirse.

El recorrido, en palabras de la propia lección

  • Arrastra para hacer la regla más gruesa. Observa cómo baja el tamaño y se mantiene la calidad.
  • Aquí está el truco: redondea cada peso a la marca más cercana de una regla más gruesa.
  • Ahora manejas tú. Haz la regla más gruesa y observa el tamaño y la calidad.
  • Los porcentajes de calidad conservada son inventados para mostrar la tendencia; los números reales varían según el modelo y la tarea.
  • Regla más gruesa, menos dígitos por peso: redondea 0.7341892 a 0.73 y guardas casi el mismo número en una fracción del espacio, y la calidad apenas se mueve.
  • Los modelos en realidad se distribuyen a 16 bits por peso (BF16): 70 mil millones de pesos × 16 bits ÷ 8 = 140 GB (÷ 8 porque 8 bits = 1 byte), todavía demasiado grande para un chip de ~80 GB. La parada FP32 de 280 GB es la vieja referencia de precisión completa; hoy nadie sirve un modelo en FP32.
  • Cada peso cae a la marca más cercana. Un poco corrido, pero apenas.
  • El valor redondeado queda un poco corrido, pero un producto punto (el multiplica-y-suma de 1.3) solo necesita valores aproximadamente correctos, así que las decisiones del modelo apenas se mueven.
  • Un detalle: unos pocos pesos "atípicos" inusualmente grandes tienen una influencia desproporcionada y se quiebran con el redondeo ingenuo a 4 bits, así que los cuantizadores reales primero calibran alrededor de ellos, o reentrenan con el redondeo en el circuito (quantization-aware training).
  • Menos bits es como menos colores en una foto: el archivo se reduce mucho, la imagen apenas cambia… hasta que cambia. Eso es la
  • El mismo modelo mental, nombres nuevos en 2026: los modelos se entrenan y distribuyen en BF16 (16 bits), la mayoría del servicio los corre en FP8 (8 bits), y los formatos FP4 (NVFP4, MXFP4) están llegando con los chips más nuevos. Cada peldaño es la jugada que acabas de hacer: la mitad de los bits, casi las mismas respuestas.
  • Puedes correr un modelo grande localmente en tu laptop, y es más pequeño y rápido pero responde un poquito peor que la versión en la nube. ¿Qué sacrificó la copia local?
  • Una build local suele estar cuantizada: cada peso se guarda en menos bits (por ejemplo INT4 en vez de FP16), lo que reduce el archivo y lo acelera con solo un pequeño costo de calidad. Ese intercambio es ideal para el día a día, pero para tareas que necesitan hasta el último gramo de precisión, recurre a la versión de mayor precisión.

La idea clave

Encoge el modelo y conserva casi toda su inteligencia.

Qué puedes hacer después de esta lección

Puedes explicar la cuantización: menos bits por peso, gran ahorro de memoria, pequeño coste de calidad.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Cuantización

Adónde lleva: ¿Hasta dónde se ha escalado esta misma máquina?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.