Skip to content
DigitalNeuron
Modelos e investigación

Mezcla de expertos (MoE)

MoE · sparse model

En corto

Mezcla de expertos divide partes de una red en muchas sub-redes paralelas y utiliza un enrutador para enviar cada token a través de solo algunas de ellas. El recuento total de parámetros se mantiene grande mientras que la computación por token se mantiene pequeña, razón por la cual varios modelos muy grandes son más baratos de servir de lo que su tamaño implica.

En un modelo denso, cada parámetro participa en el procesamiento de cada token. En un modelo de mezcla de expertos, ciertas capas se reemplazan por un conjunto de expertos paralelos y una pequeña red enrutadora selecciona a través de cuáles dos o tres de ellos pasa cada token.

La economía es el punto clave. Un modelo puede contener cientos de miles de millones de parámetros totales mientras activa solo decenas de miles de millones por token. La capacidad escala con el total; la factura de cómputo escala con la porción activa.

La contrapartida es la memoria. Todos los expertos deben estar residentes y ser accesibles, por lo que el requisito de hardware sigue a los parámetros totales, aunque la aritmética sigue a los activos. Eso hace que los modelos MoE sean atractivos para los operadores que trabajan a gran escala e incómodos para alguien que intenta ejecutar uno en un solo acelerador.

El entrenamiento presenta su propia dificultad: si el enrutador envía la mayoría de los tokens a un puñado de expertos favoritos, el resto nunca aprende nada útil. Existen objetivos de balanceo de carga para evitar esto y agregar un problema de ajuste que los modelos densos no tienen.

Preguntas frecuentes

¿Por qué los modelos MoE informan dos recuentos de parámetros?
Los parámetros totales describen el modelo completo; los parámetros activos describen cuántos se utilizan por token. El costo de cómputo rastrea el recuento activo, mientras que los requisitos de memoria rastrean el total.
¿Son los modelos MoE peores que los modelos densos?
No intrínsecamente. Dan más capacidad por unidad de cómputo, a costa de mayores requisitos de memoria y un entrenamiento más complejo, ya que el enrutador debe aprender a distribuir el trabajo de manera uniforme.

Véase también

Última actualización: 22 ago 2026