Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok

Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok ?

Mixtral 8x7B égale des modèles denses de 70B de paramètres sur la plupart des benchmarks en tournant environ 3× plus vite car seulement 2 de ses 8 experts (13B sur 47B de paramètres) s'activent par token — le même tour architectural derrière DeepSeek-V3 (671B total / 37B actifs).

Un transformeur à Mixture-of-Experts (MoE) remplace la couche feed-forward dense d'un bloc transformeur par une banque de N réseaux experts parallèles, plus un petit réseau de routage, appelé routeur, qui sélectionne les k meilleurs experts pour chaque token. Seuls les experts sélectionnés effectuent réellement un calcul pour ce token, si bien qu'un modèle construit avec huit experts et un routage top-2 n'active qu'environ un quart de ses paramètres feed-forward par token. Le résultat est un modèle qui porte le nombre de paramètres, et une grande partie de la capacité d'apprentissage, d'un très grand réseau dense, tout en ne payant que le coût d'inférence d'un réseau bien plus petit. Le MoE est la raison architecturale pour laquelle un modèle Mixtral 8x7B de 47 milliards de paramètres peut égaler des modèles denses de 70 milliards de paramètres sur la plupart des benchmarks publics, tout en tournant plusieurs fois plus vite par token.

Pourquoi c'est important

Pourquoi c'est important, en pratique

  • Le routage top-k signifie que seule une fraction des paramètres FFN calcule par token — 25 % pour le top-2-sur-8 de Mixtral — découplant qualité du modèle et coût d'inférence.
  • Les 47B de paramètres Mixtral doivent tous être chargés en mémoire GPU même si seuls 13B s'activent par token, ce qui explique pourquoi l'économie MoE fonctionne sur serveurs multi-GPU mais se brise en edge mono-GPU.
  • L'équilibrage de charge est un risque de production réel : si le routeur favorise un expert, les autres sont gaspillés, d'où des pertes auxiliaires pour forcer l'équilibre.

Points clés

  • MoE remplace le FFN dense par N experts + routeur sélectionnant k par token — Mixtral 8x7B : 47B total / 13B actifs (top-2 de 8).
  • Exemples frontière — Mixtral 8x7B (Apache 2.0, déc 2023), DeepSeek-V2 (160 experts top-6, mai 2024), DeepSeek-V3 (671B/37B actifs, classe GPT-4, déc 2024), Grok-1 (314B, mars 2024).
  • La qualité monte avec les params totaux (peu coûteux d'ajouter des experts) ; le coût monte avec les params actifs — découple les deux.
  • Piège mémoire — tous les params doivent résider GPU ; fonctionne sur serveurs multi-GPU, se brise sur edge mono-GPU.
  • Défis production — équilibrage de charge (perte auxiliaire), parallélisme d'experts (goulot all-to-all inter-GPU), instabilité d'entraînement (décisions de routage discrètes, z-loss + warmup aident).

Termes employés sur cette page

Mixture-of-Experts (MoE)
Architecture Transformer où la couche FFN dense est remplacée par N experts parallèles plus un routeur de gating qui sélectionne k experts parmi N par token ; seuls les k experts choisis calculent, découplant les paramètres totaux (qualité) des paramètres actifs (coût).
Router / gating network
Un petit réseau appris (typiquement une couche linéaire + softmax) qui score chaque token face à chaque expert et sélectionne les top-k pour le calcul effectif ; la sélection discrète top-k est la source de l'instabilité d'entraînement du MoE.
Top-k routing
La stratégie consistant à choisir les k experts au score le plus élevé par token ; k=2 est canonique (Mixtral, Grok-1), k=6+ utilisé dans les MoE à granularité plus fine comme DeepSeek-V2.
Load-balancing loss
Un objectif d'entraînement auxiliaire qui pénalise le routeur lorsqu'il envoie un volume disproportionné de tokens vers un seul expert ; prévient l'effondrement des experts où la plupart des experts deviennent inutilisés.
Expert parallelism
La stratégie d'entraînement distribué et d'inférence consistant à placer différents experts sur différents GPU ; requiert un brassage all-to-all des tokens entre GPU à chaque couche MoE, créant des goulots d'étranglement réseau.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
Control plane
La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.

Sources

  1. Mixtral of Experts (Mistral AI, 2023)
  2. DeepSeek-V2 technical report
  3. DeepSeek-V3 technical report (Dec 2024)
  4. Hugging Face MoE explainer blog
  5. xAI Grok-1 model card
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →