Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok ?
Mixtral 8x7B égale des modèles denses de 70B de paramètres sur la plupart des benchmarks en tournant environ 3× plus vite car seulement 2 de ses 8 experts (13B sur 47B de paramètres) s'activent par token — le même tour architectural derrière DeepSeek-V3 (671B total / 37B actifs).
Un transformeur à Mixture-of-Experts (MoE) remplace la couche feed-forward dense d'un bloc transformeur par une banque de N réseaux experts parallèles, plus un petit réseau de routage, appelé routeur, qui sélectionne les k meilleurs experts pour chaque token. Seuls les experts sélectionnés effectuent réellement un calcul pour ce token, si bien qu'un modèle construit avec huit experts et un routage top-2 n'active qu'environ un quart de ses paramètres feed-forward par token. Le résultat est un modèle qui porte le nombre de paramètres, et une grande partie de la capacité d'apprentissage, d'un très grand réseau dense, tout en ne payant que le coût d'inférence d'un réseau bien plus petit. Le MoE est la raison architecturale pour laquelle un modèle Mixtral 8x7B de 47 milliards de paramètres peut égaler des modèles denses de 70 milliards de paramètres sur la plupart des benchmarks publics, tout en tournant plusieurs fois plus vite par token.
Pourquoi c'est important
Pourquoi c'est important, en pratique
- Le routage top-k signifie que seule une fraction des paramètres FFN calcule par token — 25 % pour le top-2-sur-8 de Mixtral — découplant qualité du modèle et coût d'inférence.
- Les 47B de paramètres Mixtral doivent tous être chargés en mémoire GPU même si seuls 13B s'activent par token, ce qui explique pourquoi l'économie MoE fonctionne sur serveurs multi-GPU mais se brise en edge mono-GPU.
- L'équilibrage de charge est un risque de production réel : si le routeur favorise un expert, les autres sont gaspillés, d'où des pertes auxiliaires pour forcer l'équilibre.
Points clés
- MoE remplace le FFN dense par N experts + routeur sélectionnant k par token — Mixtral 8x7B : 47B total / 13B actifs (top-2 de 8).
- Exemples frontière — Mixtral 8x7B (Apache 2.0, déc 2023), DeepSeek-V2 (160 experts top-6, mai 2024), DeepSeek-V3 (671B/37B actifs, classe GPT-4, déc 2024), Grok-1 (314B, mars 2024).
- La qualité monte avec les params totaux (peu coûteux d'ajouter des experts) ; le coût monte avec les params actifs — découple les deux.
- Piège mémoire — tous les params doivent résider GPU ; fonctionne sur serveurs multi-GPU, se brise sur edge mono-GPU.
- Défis production — équilibrage de charge (perte auxiliaire), parallélisme d'experts (goulot all-to-all inter-GPU), instabilité d'entraînement (décisions de routage discrètes, z-loss + warmup aident).
Termes employés sur cette page
- Mixture-of-Experts (MoE)
- Architecture Transformer où la couche FFN dense est remplacée par N experts parallèles plus un routeur de gating qui sélectionne k experts parmi N par token ; seuls les k experts choisis calculent, découplant les paramètres totaux (qualité) des paramètres actifs (coût).
- Router / gating network
- Un petit réseau appris (typiquement une couche linéaire + softmax) qui score chaque token face à chaque expert et sélectionne les top-k pour le calcul effectif ; la sélection discrète top-k est la source de l'instabilité d'entraînement du MoE.
- Top-k routing
- La stratégie consistant à choisir les k experts au score le plus élevé par token ; k=2 est canonique (Mixtral, Grok-1), k=6+ utilisé dans les MoE à granularité plus fine comme DeepSeek-V2.
- Load-balancing loss
- Un objectif d'entraînement auxiliaire qui pénalise le routeur lorsqu'il envoie un volume disproportionné de tokens vers un seul expert ; prévient l'effondrement des experts où la plupart des experts deviennent inutilisés.
- Expert parallelism
- La stratégie d'entraînement distribué et d'inférence consistant à placer différents experts sur différents GPU ; requiert un brassage all-to-all des tokens entre GPU à chaque couche MoE, créant des goulots d'étranglement réseau.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
- Control plane
- La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
Sources
- Mixtral of Experts (Mistral AI, 2023)
- DeepSeek-V2 technical report
- DeepSeek-V3 technical report (Dec 2024)
- Hugging Face MoE explainer blog
- xAI Grok-1 model card
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.