Saltar al contenido
todas las lecciones
Operación y escalado4.12Bloqueada

Destilación: un modelo pequeño aprende de uno grande

Los modelos de frontera son enormes y caros de servir. ¿Toda tarea debe pagar el costo completo?

La idea que hay dentro

Un modelo alumno pequeño imita a un maestro grande, mucho más barato de ejecutar.

Después de esta lección

Puedes explicar la destilación: un modelo estudiante pequeño entrenado para imitar a un gran maestro, para inferencia barata.

Adónde lleva

Grande o pequeño, sus pesos quedan fijos tras el entrenamiento, entonces, ¿todavía puedes enseñarle algo nuevo?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Un modelo alumno pequeño imita a un maestro grande, mucho más barato de ejecutar.

La pregunta con la que abre

Los modelos de frontera son enormes y caros de servir. ¿Toda tarea debe pagar el costo completo?

El recorrido, en palabras de la propia lección

  • Arrastra el estudiante más pequeño. ¿Cuánta de la calidad del maestro sobrevive al encogimiento?
  • Predice: ¿cómo podría un modelo pequeño llegar a ser casi tan bueno como uno gigante?
  • La mayoría de lo que pides es rutina. ¿Cada tarea tiene que pagar precios de frontera?
  • Un estudiante pequeño hereda casi toda la habilidad de un maestro grande: barato, rápido, casi igual de bueno.
  • Estudiante más pequeño = más barato y rápido de ejecutar, hasta que la calidad finalmente se resquebraja.
  • Más pequeño, más rápido, y aún casi como el maestro.
  • Encogido demasiado: la habilidad copiada por fin empieza a fallar.
  • ¿Cómo podría un modelo pequeño terminar siendo casi tan bueno como el gigante?
  • Entrenado desde cero, un modelo pequeño queda muy por debajo del gigante, pero el gigante ya conoce las respuestas.
  • No del todo. Más texto crudo, o menos bits por peso (eso es quantization), es otro truco. La jugada más rica: aprender del propio gigante.
  • El estudiante pequeño entrena con las respuestas y probabilidades del maestro, no con texto crudo: una señal mucho más rica que aprender desde cero.
  • El maestro no dice solo "positiva": dice 80% positiva, 15% mixta. Cada ejemplo lleva el ranking completo, no solo una respuesta correcta.
  • La mayoría de lo que le pides, resúmenes, traducciones, clasificaciones rápidas, es rutina. Pagar precios de frontera por cada una es un desperdicio.
  • Ambas abaratan los modelos, pero de formas distintas. La quantization (lección 4.6) mantiene el mismo modelo y guarda cada peso en menos bits. La distillation construye un modelo genuinamente más pequeño que aprendió a imitar a uno más grande. Incluso puedes hacer ambas: destilar y luego cuantizar.
  • Una empresa lanza un modelo pequeño y barato que se siente casi tan agudo como el gigante de frontera que tiene al lado. ¿Cómo llegó un modelo tan pequeño a ser tan bueno?
  • Distillation: el estudiante pequeño se entrenó para imitar las respuestas del maestro grande, heredando casi toda la habilidad a una fracción del tamaño y el costo. Por eso la mayoría de los modelos rápidos y baratos que usas a diario rinden muy por encima de su tamaño.
  • El estudiante entrena con las respuestas del maestro: copia qué decir, no solo texto crudo.
  • Números de fidelidad ilustrativos, los resultados reales de distillation varían según la tarea.
  • Fíjate en la diferencia: la barra del estudiante cae mucho en tamaño, casi nada en calidad.

La idea clave

Un estudiante pequeño puede heredar casi toda la habilidad de un gran maestro, barato de ejecutar, casi igual de bueno.

Qué puedes hacer después de esta lección

Puedes explicar la destilación: un modelo estudiante pequeño entrenado para imitar a un gran maestro, para inferencia barata.

Ponte a prueba: ¿Qué es la destilación de modelos?
  • Entrenar un modelo estudiante pequeño para imitar a un maestro grande(correcta)
  • Quitar bits de cada peso
  • Borrar tokens raros del vocabulario
  • Cachear salidas pasadas

La destilación entrena un modelo estudiante pequeño para copiar las salidas de un maestro grande, metiendo gran parte de la calidad en un modelo más barato y rápido.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Destilación

Adónde lleva: Grande o pequeño, sus pesos quedan fijos tras el entrenamiento, entonces, ¿todavía puedes enseñarle algo nuevo?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.