Explicador en lenguaje claro
Destilación, cómo un modelo chico aprende de uno grande
La destilación de modelos es un método de entrenamiento: un modelo estudiante pequeño aprende a imitar a un maestro grande entrenando con las salidas del maestro, y a veces con sus probabilidades completas, en vez de solo texto crudo. El resultado es un modelo más barato que conserva casi toda la habilidad del maestro en lo que aprendió de él.
¿Qué es la destilación de modelos y por qué la versión mini es tan buena?
La destilación entrena un modelo estudiante pequeño con las salidas de un modelo maestro grande, en vez de solo con texto crudo. Las respuestas del maestro son más limpias y consistentes que internet, y en las versiones más ricas el estudiante también aprende de cuánta confianza tenía el maestro en cada opción, no solo de su elección final. El estudiante termina mucho mejor que un modelo de su tamaño entrenado desde cero. Hereda el estilo del maestro y también sus errores, y no lo supera.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Del internet a tu respuesta →Gratis, sin código, sin registro.
Diez segundos, sin lección: juega con el widget independiente, e insértalo en tu propia página.
Y después ve más a fondo: Destilación: un modelo pequeño aprende de uno grande Bloqueada
¿Cómo funciona la destilación de modelos en la práctica?
Empieza con dos modelos. El maestro es grande, lento y capaz. El estudiante es chico, rápido y, al principio, nada capaz. La destilación es cualquier receta de entrenamiento donde el estudiante aprende del comportamiento del maestro en vez de solo de texto crudo. Nada se copia del maestro y este nunca se encoge. El estudiante es una red aparte que se va moldeando, salida por salida, hasta imitar de cerca al maestro en las tareas que te importan.
La versión clásica, formulada para redes neuronales por Geoffrey Hinton y colegas en 2015, entrena al estudiante con etiquetas blandas, las soft labels. Cuando un modelo de lenguaje predice el siguiente token, no elige solo un ganador. Asigna una probabilidad a cada token de su vocabulario. Esa distribución completa es rica: dice que sillón era casi tan plausible como sofá, y que banana nunca tuvo chance. Entrenar al estudiante para igualar la distribución entera, a menudo suavizada con una temperatura para que las preferencias pequeñas se vean, le enseña cómo pondera opciones el maestro, no solo cuál eligió.
La versión que domina la era de los LLM es más simple: destilación con datos sintéticos. Le haces prompts al maestro a gran escala, te quedas con sus mejores salidas y haces fine-tuning del estudiante con esos pares de entrada y salida como texto de entrenamiento normal. No hace falta acceso interno, y eso importa, porque las APIs casi nunca exponen probabilidades. Así construyó DeepSeek sus distills de R1: curó unas 800 mil muestras de razonamiento del R1 completo e hizo fine-tuning de modelos Qwen y Llama mucho más chicos. La lección interactiva de destilación en este sitio te deja correr el ciclo maestro-estudiante a escala de juguete.
¿Por qué los laboratorios destilan sus modelos más grandes?
Porque el entrenamiento ocurre una vez y servir el modelo ocurre para siempre. Un modelo de frontera se entrena en una corrida gigante y después responde millones de peticiones al día, y cada respuesta cuesta cómputo. La mayoría de esas peticiones son rutinarias. Atenderlas todas con el modelo más grande es pagar precio de frontera, y latencia de frontera, por trabajo que un modelo mucho más chico podría resolver. Destilar el buque insignia en un nivel pequeño conserva la mayor parte de la calidad donde de verdad vive el tráfico, a una fracción del costo por petición.
Hay una segunda razón más silenciosa: las salidas del maestro son mejores datos de entrenamiento que internet. La web cruda es contradictoria, desordenada y llena de basura. Las respuestas de un buen maestro son consistentes, están bien formateadas y ya tienen la forma del comportamiento que quieres. Un modelo chico entrenado con ellas termina muy por delante de un modelo idéntico entrenado desde cero con texto raspado de la web.
El patrón está en todas partes cuando lo buscas. Google describió el primer Gemini Flash como destilado de su hermano Pro más grande, y su familia abierta Gemma acredita destilación de conocimiento en sus reportes técnicos. Meta contó que sus modelos Llama 3.2 tamaño teléfono se construyeron podando Llamas más grandes y recuperando calidad con destilación que usó las probabilidades de salida de los modelos mayores. Y toda familia importante vende niveles mini, flash o small con precios muy por debajo del buque insignia. Los proveedores rara vez detallan la receta, pero la destilación es la herramienta estándar para ese trabajo.
Destilación, cuantización y poda: ¿en qué se diferencian?
Las tres hacen más barato correr un modelo, y la gente las confunde todo el tiempo. La destilación entrena un modelo nuevo y más chico para imitar al grande. La cuantización conserva el mismo modelo pero guarda cada peso en menos bits, cambiando un poco de precisión por mucha memoria. La poda, pruning en inglés, borra pesos, neuronas o capas enteras de un modelo existente, casi siempre con entrenamiento extra después para reparar el daño.
La diferencia práctica: un modelo cuantizado es el mismo cerebro un poco borroso, así que se comporta casi igual. Un modelo destilado es otro cerebro educado por el primero, así que puede comportarse distinto en todo lo que nunca le enseñaron. La poda queda en el medio, el mismo cerebro con piezas quitadas. Además se apilan. Los modelos chicos de Llama 3.2 fueron podados y luego destilados, y en teléfonos es común cuantizar encima al estudiante destilado, así que un modelo en el dispositivo puede ser las tres cosas a la vez.
| Técnica | Qué cambia | ¿Reentrenar? | Uso típico |
|---|---|---|---|
| Destilación | Un modelo nuevo más chico aprende a imitar al grande | Sí, un entrenamiento completo del estudiante | Niveles mini y flash, asistentes en el dispositivo |
| Cuantización | El mismo modelo con menos bits por peso, por ejemplo de 16 a 4 bits | Poco o nada, normalmente solo calibración | Correr modelos abiertos en hardware de consumo |
| Poda | Se borran pesos o capas enteras | Casi siempre, para recuperar la precisión perdida | Recortar un modelo, a menudo junto con destilación |
¿Cuánto más chico y más barato es un modelo destilado?
No hay una proporción fija, pero los ejemplos publicados caen en un rango reconocible: ahorros dramáticos en tamaño y velocidad, pérdidas modestas en las tareas medidas. El número temprano más limpio viene de DistilBERT en 2019: 40 por ciento menos parámetros y 60 por ciento más rápido, conservando cerca del 97 por ciento de la comprensión de lenguaje medida del maestro. Esa forma, casi toda la calidad por una fracción del costo, es todo el argumento de venta de la destilación.
La vitrina moderna es DeepSeek-R1. El maestro completo es un modelo mixture-of-experts de 671 mil millones de parámetros, hardware que poca gente puede correr. Sus estudiantes destilados, publicados junto con él a comienzos de 2025, van desde 70 mil millones de parámetros hasta el tamaño 1.5B. Según las propias evaluaciones de DeepSeek, el distill 32B superó a o1-mini de OpenAI en benchmarks de razonamiento con más o menos una veinteava parte de los parámetros totales del maestro, y hasta la versión 1.5B, tamaño laptop, superó a modelos generales mucho más grandes en matemática de competencia, aunque queda débil fuera de ese carril.
El precio sigue al tamaño. Dentro de la línea de un proveedor, a mediados de 2026, el nivel pequeño suele costar entre 5 y 10 veces menos por token que el nivel de frontera, y responde más rápido. Eso sí, toma con cuidado los números de calidad conservada: se miden en las tareas para las que se destiló el estudiante, y la expectativa honesta fuera de ellas es más baja.
| Estudiante vs maestro | Cambio de tamaño y velocidad | Qué se conservó |
|---|---|---|
| DistilBERT vs BERT, 2019 | 40% menos parámetros, 60% más rápido | Cerca del 97% de la comprensión de lenguaje medida |
| R1-Distill-Qwen-32B vs DeepSeek-R1, 671B | Unas 20 veces menos parámetros totales | Superó a o1-mini en benchmarks de razonamiento, según DeepSeek |
| R1-Distill-Qwen-1.5B vs DeepSeek-R1, 671B | Cientos de veces más chico, tamaño laptop | La matemática de competencia se mantuvo, la habilidad amplia no |
| Nivel API pequeño vs frontera, mediados de 2026 | Entre 5 y 10 veces más barato por token | La mayoría de las peticiones rutinarias, la cola difícil se cae |
¿Cuándo pierde la destilación?
El techo es el maestro. En las tareas para las que se destiló, un estudiante puede acercarse al maestro y, cuando los datos se filtraron para conservar solo las respuestas correctas del maestro, a veces superar su promedio. No supera lo que el maestro sabe. Y si el maestro alucina un dato, prefiere un patrón equivocado o carga un sesgo, el estudiante también lo aprende, a escala industrial.
La falla más filosa es la estrechez. La capacidad es justo lo que quitaste, y lo primero que suelta un modelo chico es el conocimiento raro y las combinaciones inusuales. Un distill afinado con trazas de razonamiento puede arrasar en concursos de matemática y aún así tropezar con preguntas generales que su maestro responde fácil. Un estudio conocido de 2023 sobre modelos de imitación encontró que los estudiantes copian el estilo seguro del maestro con más fidelidad que su exactitud factual, lo que los vuelve mejores para sonar correctos que para serlo.
También hay una trampa de evaluación. Un modelo destilado tiende a verse excelente en benchmarks cercanos a sus datos de entrenamiento, porque hacia eso fue optimizado. La brecha aparece en tu tráfico real, en las peticiones raras que ningún benchmark cubrió. Antes de cambiar un modelo de frontera por un distill, corre tus propias evals con tus propios ejemplos, sobre todo los feos.
¿Se puede destilar desde un modelo detrás de una API, y está permitido?
Técnicamente sí, y justo por eso se impuso la receta de datos sintéticos. Solo necesitas salidas, y salidas es lo que vende una API. La mayoría de las APIs comerciales no te da las distribuciones de probabilidad completas, así que la receta clásica de soft labels queda fuera de alcance, pero los pares simples de pregunta y respuesta alcanzan para mover mucha capacidad.
Otra cosa es si tienes permiso. Los términos de servicio de los grandes proveedores cerrados, incluidos OpenAI, Anthropic, Mistral y xAI, prohíben usar sus salidas para construir modelos competidores. La regla llegó a las portadas a comienzos de 2025, cuando OpenAI dijo tener evidencia de que DeepSeek había entrenado con salidas de sus modelos, después de haber bloqueado cuentas que sospechaba de cosechar datos a escala. La disputa quedó abierta más que resuelta, y convirtió la destilación de un término de laboratorio en uno geopolítico.
También hay carriles totalmente permitidos. Las licencias de pesos abiertos en general dejan destilar los modelos que descargas, a veces con reglas de atribución, y DeepSeek publicó sus propios distills abiertamente. Los proveedores hasta venden el flujo dentro de su propia familia: OpenAI ofrece en su plataforma de API un pipeline de destilación que guarda las salidas de un modelo grande y hace fine-tuning de uno más chico con ellas, y Amazon Bedrock vende destilación gestionada de la misma forma. Destilar el nivel caro que ya usas hacia el barato es un camino de producto soportado. Cruzando líneas de proveedor, lee primero los términos. Nada de esto es asesoría legal.
Lo que la gente entiende mal
- La destilación comprime el modelo grande. Entrena un modelo chico aparte para imitarlo, y por eso el estudiante puede comportarse distinto en casos que al maestro nunca le preguntaron.
- Es lo mismo que la cuantización. La cuantización guarda el mismo modelo con menos bits por peso. La destilación entrena un modelo distinto y más chico.
- Un modelo destilado es casi igual de capaz en general. Se acerca al maestro en el tipo de tarea para la que se destiló y cae fuera de ella.
- La destilación es robo por definición. Los laboratorios destilan sus propios modelos todo el tiempo y venden herramientas para hacerlo. Las disputas son por destilar el modelo de otro contra sus términos de servicio, no por la técnica.
Dónde lo ves en productos reales
- Los niveles mini, flash y small de todas las familias de modelos grandes.
- Asistentes en el dispositivo, en teléfonos y portátiles, que nunca llaman a un servidor.
- Clasificadores baratos de alto volumen construidos destilando un modelo de frontera sobre una sola tarea estrecha.
- Distills de razonamiento de pesos abiertos, como las versiones R1 de Qwen y Llama, tan chicos que corren en una GPU o una laptop.
Preguntas frecuentes
- ¿Qué significa que un modelo sea destilado?
- Que fue entrenado, al menos en parte, para imitar las salidas de un modelo más grande en vez de aprender solo de datos crudos. Un modelo destilado es una red aparte y más chica, no una copia comprimida del grande. Espera comportamiento de maestro en las tareas para las que se destiló y una cola larga más flaca en todo lo demás.
- ¿En qué se diferencia la destilación del fine-tuning?
- En el origen de los datos de entrenamiento. El fine-tuning enseña a un modelo con ejemplos que reuniste tú. La destilación enseña a un modelo chico con las respuestas de un modelo grande, y por eso puedes generar todos los datos de entrenamiento que puedas pagar.
- ¿Qué es un modelo maestro-estudiante?
- Es el nombre estándar del montaje de destilación. El maestro es un modelo grande ya entrenado cuyas salidas, y a veces cuyas distribuciones de probabilidad completas, se vuelven la señal de entrenamiento. El estudiante es el modelo más chico que se entrena para igualarlas. Un solo maestro puede generar datos para toda una familia de estudiantes de distintos tamaños.
- ¿Un estudiante puede superar a su maestro?
- No en aquello para lo que se destiló, aunque sí puede ganarle en velocidad, costo y consistencia. A veces los estudiantes puntúan más alto en benchmarks estrechos cuando los datos de destilación se filtraron para quedarse solo con respuestas correctas, lo que quita parte del ruido del maestro.
- ¿Cuántos datos hacen falta para destilar un modelo?
- Menos que un preentrenamiento, más que un fine-tuning ligero. Un distill estrecho de una sola tarea puede funcionar con unos miles de salidas del maestro. Un comportamiento amplio pide mucho más: DeepSeek curó unas 800 mil muestras de razonamiento para crear sus distills de R1. Generar esos datos es un costo real, porque cada muestra es una corrida completa del maestro caro.
- ¿Es legal destilar desde un modelo comercial?
- Los términos de los proveedores suelen prohibir usar sus salidas para entrenar un modelo competidor, y es un tema en disputa activa más que una cuestión cerrada. Revisa los términos del modelo que estás llamando antes de construir un producto sobre sus salidas.
- ¿Los modelos de razonamiento cambian cómo funciona la destilación?
- Cambiaron qué se transfiere. La cadena de razonamiento visible de un modelo de razonamiento es parte de su salida, así que el estudiante entrena con soluciones desarrolladas, no con respuestas peladas. Por eso los distills chicos de R1 se volvieron tan buenos en matemática: imitan la traza de razonamiento misma. El estilo se transfiere con más fiabilidad que el juicio de fondo, así que los estudiantes igual se rompen en problemas que su maestro atraparía.
Explicadores relacionados
Más en Cómo se entrenan los modelos
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.