Saltar al contenido
todas las lecciones
Operación y escalado4.5Bloqueada

Mezcla de expertos

¿Cómo añadir parámetros sin pagar por ellos en cada token?

La idea que hay dentro

Un enrutador envía cada token a unas pocas FFN expertas; la dispersión desacopla el coste.

Después de esta lección

Puedes explicar la mezcla de expertos: enrutar a unos pocos expertos, todo el conocimiento, bajo coste.

Adónde lleva

El modelo es demasiado grande para caber o servirse…

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Un enrutador envía cada token a unas pocas FFN expertas; la dispersión desacopla el coste.

La pregunta con la que abre

¿Cómo añadir parámetros sin pagar por ellos en cada token?

El recorrido, en palabras de la propia lección

  • Baja el top-k arrastrando. Predice: ¿qué tan bajo puede ir el cómputo antes de que caiga el conocimiento?
  • El router puntúa a cada experto, y luego despierta solo a tus top-k.
  • Crece el estante a 16 expertos. ¿La cuenta por palabra sigue el mismo camino?
  • Baja a 1 experto y las respuestas sí empeoran en los modelos reales. Se quedan alrededor de 2 de muchos, el punto justo que encontraste.
  • El router es un recepcionista: puntúa qué tan bien encaja cada experto con esta palabra (un producto punto, como los scores de la atención en la 3.3), y luego despierta solo a los top-k con mayor puntaje. Los puntajes aquí son números de juguete ilustrativos: aproximadamente cómo se ve el ruteo, no medidos.
  • Cada palabra solo necesita un par de especialidades a la vez, gramática aquí, cocina allá. Los demás expertos guardan conocimiento que ESTA palabra no necesita ahora mismo.
  • Duplicaste el estante: el doble de conocimiento. Pero cada palabra sigue despertando solo a sus mejores 2, así que la cuenta por palabra no se movió.
  • El costo se paga por palabra, y una palabra sigue despertando solo a 2 expertos. Crecer de 8 expertos a 16 te llevó de 2-de-8 a 2-de-16: el doble de conocimiento en el estante, los mismos 2 haciendo el trabajo.
  • Llevan este estante mucho más lejos: el MoE de grano fino usa cientos de expertos pequeños de los que solo se despierta un puñado por token, más un experto compartido que queda siempre encendido para los patrones comunes que toda palabra necesita. DeepSeek V3 despierta 8 de 256 expertos más 1 compartido; la mayoría de los modelos de frontera hoy son MoE por dentro.
  • Las fichas técnicas anuncian ambos números: parámetros totales, el estante completo, y parámetros activos, lo que despierta una palabra. "1T totales, 32B activos" significa exactamente esto.
  • Los expertos son especialistas por materia, un comité de chatbots: uno para derecho, uno para medicina, uno para código.
  • El ruteo ocurre dentro de un solo modelo, y los expertos se reparten patrones de tokens (puntuación, números, sintaxis) que ningún plan de estudios humano reconocería.
  • Dos modelos se anuncian con el mismo recuento enorme de parámetros, pero uno es mucho más barato y rápido de ejecutar. ¿Cómo puede un modelo gigante seguir siendo barato por palabra?
  • Un modelo Mixture of Experts envía cada palabra solo a sus pocos mejores expertos, así que la mayoría de los parámetros se quedan dormidos en cada palabra. El conocimiento total en el estante es enorme, pero el cómputo pagado por palabra es pequeño, por eso un MoE puede tener conocimiento de escala de frontera a una fracción del costo de ejecución de un modelo denso.

La idea clave

Más conocimiento, el mismo coste por token.

Qué puedes hacer después de esta lección

Puedes explicar la mezcla de expertos: enrutar a unos pocos expertos, todo el conocimiento, bajo coste.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Mixture of Experts

Adónde lleva: El modelo es demasiado grande para caber o servirse…

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.