Saltar al contenido

Explicador en lenguaje claro

Mixture of Experts, explicado

¿Qué es un modelo Mixture of Experts y por qué lo usan los laboratorios?

Un modelo Mixture of Experts reemplaza algunas capas por muchas sub-redes en paralelo, los experts, más un pequeño router que elige unos pocos para cada token. El modelo puede tener una cantidad enorme de parámetros, pero solo corren los experts elegidos, así que cada token cuesta una fracción del cómputo. Ese es el truco: la capacidad de un modelo gigante a un precio más cercano al de uno pequeño. Las decisiones del router se aprenden, no se programan.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: Mezcla de expertos Bloqueada

Lo que la gente entiende mal

  • Los experts son especialistas por tema, uno de leyes, otro de medicina. El enrutado se aprende por token y suele seguir patrones como puntuación o sintaxis, no temas humanos.
  • Un modelo MoE usa todos sus parámetros en cada petición. Solo corren los pocos experts que el router elige para cada token.
  • Más experts siempre da un modelo mejor. Equilibrar el router para que todos se usen por igual es un problema real de ingeniería.

Dónde lo ves en productos reales

  • Nombres como Mixtral 8x7B anuncian el número de experts en el propio nombre.
  • Los titulares sobre modelos de frontera sorprendentemente baratos suelen deberse a la eficiencia del MoE.
  • Cuando un modelo muy grande cuesta menos de lo que sugiere su tamaño, casi siempre significa pocos parámetros activos por token.

Preguntas frecuentes

¿Un modelo mixture of experts sabe más?
Puede guardar más parámetros con el mismo costo de ejecución, y eso suele significar más capacidad de conocimiento. Pero solo una fracción de ellos se activa para cada token, así que un modelo sparse con un total enorme no equivale a un modelo denso del mismo tamaño de titular.
¿Los experts son especialistas en temas?
No de la forma ordenada que sugiere el nombre. El routing se aprende, no se asigna, así que lo que acaba manejando un expert son patrones estadísticos más que el experto en medicina. Sí aparece algo de agrupación temática, pero no puedes elegir un expert por materia.
¿Por qué los laboratorios dan dos cifras de parámetros?
Una es el total de parámetros guardados y la otra los parámetros activos por token. La memoria y el costo de alojamiento siguen al total, el cómputo por token sigue a los activos. Dar solo el número grande es como un modelo sparse suena más grande de lo que corre.

Explicadores relacionados

Más en Dentro del transformer

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.