Destilación: un modelo pequeño aprende de uno grande
Los modelos de frontera son enormes y caros de servir. ¿Toda tarea debe pagar el costo completo?
La idea que hay dentro
Un modelo alumno pequeño imita a un maestro grande, mucho más barato de ejecutar.
Después de esta lección
Puedes explicar la destilación: un modelo estudiante pequeño entrenado para imitar a un gran maestro, para inferencia barata.
Adónde lleva
Grande o pequeño, sus pesos quedan fijos tras el entrenamiento, entonces, ¿todavía puedes enseñarle algo nuevo?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Un modelo alumno pequeño imita a un maestro grande, mucho más barato de ejecutar.
La pregunta con la que abre
Los modelos de frontera son enormes y caros de servir. ¿Toda tarea debe pagar el costo completo?
El recorrido, en palabras de la propia lección
- Arrastra el estudiante más pequeño. ¿Cuánta de la calidad del maestro sobrevive al encogimiento?
- Predice: ¿cómo podría un modelo pequeño llegar a ser casi tan bueno como uno gigante?
- La mayoría de lo que pides es rutina. ¿Cada tarea tiene que pagar precios de frontera?
- Un estudiante pequeño hereda casi toda la habilidad de un maestro grande: barato, rápido, casi igual de bueno.
- Estudiante más pequeño = más barato y rápido de ejecutar, hasta que la calidad finalmente se resquebraja.
- Más pequeño, más rápido, y aún casi como el maestro.
- Encogido demasiado: la habilidad copiada por fin empieza a fallar.
- ¿Cómo podría un modelo pequeño terminar siendo casi tan bueno como el gigante?
- Entrenado desde cero, un modelo pequeño queda muy por debajo del gigante, pero el gigante ya conoce las respuestas.
- No del todo. Más texto crudo, o menos bits por peso (eso es quantization), es otro truco. La jugada más rica: aprender del propio gigante.
- El estudiante pequeño entrena con las respuestas y probabilidades del maestro, no con texto crudo: una señal mucho más rica que aprender desde cero.
- El maestro no dice solo "positiva": dice 80% positiva, 15% mixta. Cada ejemplo lleva el ranking completo, no solo una respuesta correcta.
- La mayoría de lo que le pides, resúmenes, traducciones, clasificaciones rápidas, es rutina. Pagar precios de frontera por cada una es un desperdicio.
- Ambas abaratan los modelos, pero de formas distintas. La quantization (lección 4.6) mantiene el mismo modelo y guarda cada peso en menos bits. La distillation construye un modelo genuinamente más pequeño que aprendió a imitar a uno más grande. Incluso puedes hacer ambas: destilar y luego cuantizar.
- Una empresa lanza un modelo pequeño y barato que se siente casi tan agudo como el gigante de frontera que tiene al lado. ¿Cómo llegó un modelo tan pequeño a ser tan bueno?
- Distillation: el estudiante pequeño se entrenó para imitar las respuestas del maestro grande, heredando casi toda la habilidad a una fracción del tamaño y el costo. Por eso la mayoría de los modelos rápidos y baratos que usas a diario rinden muy por encima de su tamaño.
- El estudiante entrena con las respuestas del maestro: copia qué decir, no solo texto crudo.
- Números de fidelidad ilustrativos, los resultados reales de distillation varían según la tarea.
- Fíjate en la diferencia: la barra del estudiante cae mucho en tamaño, casi nada en calidad.
La idea clave
Un estudiante pequeño puede heredar casi toda la habilidad de un gran maestro, barato de ejecutar, casi igual de bueno.
Qué puedes hacer después de esta lección
Puedes explicar la destilación: un modelo estudiante pequeño entrenado para imitar a un gran maestro, para inferencia barata.
Ponte a prueba: ¿Qué es la destilación de modelos?
- Entrenar un modelo estudiante pequeño para imitar a un maestro grande(correcta)
- Quitar bits de cada peso
- Borrar tokens raros del vocabulario
- Cachear salidas pasadas
La destilación entrena un modelo estudiante pequeño para copiar las salidas de un maestro grande, metiendo gran parte de la calidad en un modelo más barato y rápido.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Destilación
Adónde lleva: Grande o pequeño, sus pesos quedan fijos tras el entrenamiento, entonces, ¿todavía puedes enseñarle algo nuevo?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.