Widget interactivo · gratis · insertable
Mixture of Experts: manda cada palabra a sus experts
Baja el top-k y predice cuánto puede bajar el cómputo antes de que caiga el conocimiento. Después agranda el estante y mira si la cuenta por palabra lo sigue.
4/8
expertos despiertos
~50%
cómputo de expertos por palabra
100%
conocimiento disponible
Qué vas a hacer
- 1Baja el top-k. Predice cuántos experts puede despertar una palabra antes de que las respuestas empeoren.
- 2Mira al router puntuar a cada expert y despertar solo a los top-k con mejor puntuación.
- 3Agranda el estante de 8 experts a 16. El doble de conocimiento, y la cuenta por palabra no se mueve.
Qué muestra
Un modelo Mixture of Experts reemplaza algunas de sus capas por un estante de sub-redes en paralelo, los experts, más un router pequeño. Para cada palabra, el router puntúa qué tan bien encaja cada expert, un producto punto como los de attention, y despierta solo a los pocos mejores. Los demás experts siguen dormidos. Guardan conocimiento que esta palabra no necesita ahora.
El widget te deja mover las dos perillas que importan. Top-k es cuántos experts despierta una palabra. Bájalo a uno y las respuestas empeoran en los modelos reales; se asientan cerca de dos entre muchos, que es el punto justo que vas a encontrar tú mismo. El tamaño del estante es cuántos experts existen. Agrándalo de 8 a 16 y duplicaste el conocimiento en el estante, pero cada palabra sigue despertando a sus dos mejores, así que el costo por palabra se queda plano.
Ese desacople es todo el truco. Las fichas técnicas anuncian los dos números: parámetros totales, el estante entero, y parámetros activos, lo que despierta una palabra. Una línea como un billón totales, treinta y dos mil millones activos significa exactamente lo que acabas de hacer en el escenario.
Por qué importa
La mayoría de los modelos frontera de hoy son MoE por dentro. Las versiones de grano fino llevan el estante mucho más lejos: cientos de experts pequeños con un puñado despierto por token, más un expert compartido que se queda encendido para los patrones comunes que toda palabra necesita. DeepSeek V3 despierta 8 de 256 experts más uno compartido. Así un modelo puede guardar conocimiento a escala frontera mientras corre a una fracción del costo por palabra de un modelo denso.
La idea clave
Más conocimiento en el estante, los mismos pocos experts haciendo el trabajo por palabra.
Nota honesta: Las puntuaciones del router son números de juguete ilustrativos, más o menos cómo se ve el routing, no medidos de un modelo real. En los modelos reales los experts se reparten patrones de tokens como puntuación y sintaxis, no materias humanas como derecho o medicina.
Este widget es una etapa de una lección completa, con la historia alrededor.
Gratis, sin código, sin registro.
Inserta este widget
Pega esto en cualquier página HTML, plataforma de cursos, wiki o herramienta de diapositivas que acepte un iframe. Funciona sin cuenta, no pone cookies propias y enlaza de vuelta aquí.
La atribución ya viene incluida. Si escribes sobre él, un enlace a esta página es todo lo que pedimos.
Preguntas frecuentes
- ¿Los experts son especialistas en temas?
- No. El routing se aprende por token y tiende a seguir patrones como puntuación, números o sintaxis, no materias humanas. La imagen del comité de chatbots es el malentendido más común sobre MoE.
- ¿Un modelo MoE usa todos sus parámetros en cada petición?
- No. Solo corren los experts que el router elige para cada token. Por eso la cuenta de parámetros totales y la de parámetros activos son números distintos, y por eso la activa es la que fija el costo por palabra.
- ¿Puedo insertar este widget de MoE en mi sitio?
- Sí. El fragmento iframe de esta página funciona en cualquier página HTML, plataforma de cursos o herramienta de diapositivas que acepte un iframe. No necesita cuenta y enlaza de vuelta a la lección completa.
Explicadores relacionados
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.