Saltar al contenido

Explicador en lenguaje claro

Destilación, cómo un modelo chico aprende de uno grande

¿Qué es la destilación de modelos y por qué la versión mini es tan buena?

La destilación entrena un modelo estudiante pequeño con las salidas de un modelo maestro grande, en vez de solo con texto crudo. Las respuestas del maestro son más limpias y consistentes que internet, y en las versiones más ricas el estudiante también aprende de cuánta confianza tenía el maestro en cada opción, no solo de su elección final. El estudiante termina mucho mejor que un modelo de su tamaño entrenado desde cero. Hereda el estilo del maestro y también sus errores, y no lo supera.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: Destilación: un modelo pequeño aprende de uno grande Bloqueada

Lo que la gente entiende mal

  • La destilación comprime el modelo grande. Entrena un modelo chico aparte para imitarlo, y por eso el estudiante puede comportarse distinto en casos que al maestro nunca le preguntaron.
  • Es lo mismo que la cuantización. La cuantización guarda el mismo modelo con menos bits por peso. La destilación entrena un modelo distinto y más chico.
  • Un modelo destilado es casi igual de capaz en general. Se acerca al maestro en el tipo de tarea para la que se destiló y cae fuera de ella.

Dónde lo ves en productos reales

  • Los niveles mini, flash y small de todas las familias de modelos grandes.
  • Asistentes en el dispositivo, en teléfonos y portátiles, que nunca llaman a un servidor.
  • Clasificadores baratos de alto volumen construidos destilando un modelo de frontera sobre una sola tarea estrecha.

Preguntas frecuentes

¿En qué se diferencia la destilación del fine-tuning?
En el origen de los datos de entrenamiento. El fine-tuning enseña a un modelo con ejemplos que reuniste tú. La destilación enseña a un modelo chico con las respuestas de un modelo grande, y por eso puedes generar todos los datos de entrenamiento que puedas pagar.
¿Un estudiante puede superar a su maestro?
No en aquello para lo que se destiló, aunque sí puede ganarle en velocidad, costo y consistencia. A veces los estudiantes puntúan más alto en benchmarks estrechos cuando los datos de destilación se filtraron para quedarse solo con respuestas correctas, lo que quita parte del ruido del maestro.
¿Es legal destilar desde un modelo comercial?
Los términos de los proveedores suelen prohibir usar sus salidas para entrenar un modelo competidor, y es un tema en disputa activa más que una cuestión cerrada. Revisa los términos del modelo que estás llamando antes de construir un producto sobre sus salidas.

Explicadores relacionados

Más en Cómo se entrenan los modelos

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.