AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok

Architectures Mixture-of-Experts (MoE) — Mixtral / DeepSeek / Grok — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-10-06

Qu'est-ce que Architectures Mixture-of-Experts (MoE) ?

Mixtral 8x7B égale des modèles denses de 70B de paramètres sur la plupart des benchmarks en tournant environ 3× plus vite car seulement 2 de ses 8 experts (13B sur 47B de paramètres) s'activent par token — le même tour architectural derrière DeepSeek-V3 (671B total / 37B actifs).

De quoi il s'agit

Un transformeur à Mixture-of-Experts (MoE) remplace la couche feed-forward dense d'un bloc transformeur par une banque de N réseaux experts parallèles, plus un petit réseau de routage, appelé routeur, qui sélectionne les k meilleurs experts pour chaque token. Seuls les experts sélectionnés effectuent réellement un calcul pour ce token, si bien qu'un modèle construit avec huit experts et un routage top-2 n'active qu'environ un quart de ses paramètres feed-forward par token. Le résultat est un modèle qui porte le nombre de paramètres, et une grande partie de la capacité d'apprentissage, d'un très grand réseau dense, tout en ne payant que le coût d'inférence d'un réseau bien plus petit. Le MoE est la raison architecturale pour laquelle un modèle Mixtral 8x7B de 47 milliards de paramètres peut égaler des modèles denses de 70 milliards de paramètres sur la plupart des benchmarks publics, tout en tournant plusieurs fois plus vite par token.

Pourquoi c'est important

  • Le routage top-k signifie que seule une fraction des paramètres FFN calcule par token — 25 % pour le top-2-sur-8 de Mixtral — découplant qualité du modèle et coût d'inférence.
  • Les 47B de paramètres Mixtral doivent tous être chargés en mémoire GPU même si seuls 13B s'activent par token, ce qui explique pourquoi l'économie MoE fonctionne sur serveurs multi-GPU mais se brise en edge mono-GPU.
  • L'équilibrage de charge est un risque de production réel : si le routeur favorise un expert, les autres sont gaspillés, d'où des pertes auxiliaires pour forcer l'équilibre.

Points clés

  • MoE remplace le FFN dense par N experts + routeur sélectionnant k par token — Mixtral 8x7B : 47B total / 13B actifs (top-2 de 8).
  • Exemples frontière — Mixtral 8x7B (Apache 2.0, déc 2023), DeepSeek-V2 (160 experts top-6, mai 2024), DeepSeek-V3 (671B/37B actifs, classe GPT-4, déc 2024), Grok-1 (314B, mars 2024).
  • La qualité monte avec les params totaux (peu coûteux d'ajouter des experts) ; le coût monte avec les params actifs — découple les deux.
  • Piège mémoire — tous les params doivent résider GPU ; fonctionne sur serveurs multi-GPU, se brise sur edge mono-GPU.
  • Défis production — équilibrage de charge (perte auxiliaire), parallélisme d'experts (goulot all-to-all inter-GPU), instabilité d'entraînement (décisions de routage discrètes, z-loss + warmup aident).
  • Les propres modèles de fondation tabulaires de SAP (SAP-RPT-1.6, TabPFN-3.5-Plus, tous deux GA sur le generative AI hub) sont des transformers denses à apprentissage en contexte, pas du MoE — ne pas extrapoler l'intuition coût/qualité de Mixtral/DeepSeek vers SAP-RPT.
  • Pour un appel hébergé sur le generative AI hub, la facturation en AI Units est opaque quant aux experts activés pour une requête donnée — l'arbitrage mémoire/paramètres actifs du MoE ne devient le problème du client que lors de l'auto-hébergement d'un checkpoint MoE ouvert sur SAP AI Core.

Termes employés sur cette page

Mixture-of-Experts (MoE)
Architecture Transformer où la couche FFN dense est remplacée par N experts parallèles plus un routeur de gating qui sélectionne k experts parmi N par token ; seuls les k experts choisis calculent, découplant les paramètres totaux (qualité) des paramètres actifs (coût).
Router / gating network
Un petit réseau appris (typiquement une couche linéaire + softmax) qui score chaque token face à chaque expert et sélectionne les top-k pour le calcul effectif ; la sélection discrète top-k est la source de l'instabilité d'entraînement du MoE.
Top-k routing
La stratégie consistant à choisir les k experts au score le plus élevé par token ; k=2 est canonique (Mixtral, Grok-1), k=6+ utilisé dans les MoE à granularité plus fine comme DeepSeek-V2.
Load-balancing loss
Un objectif d'entraînement auxiliaire qui pénalise le routeur lorsqu'il envoie un volume disproportionné de tokens vers un seul expert ; prévient l'effondrement des experts où la plupart des experts deviennent inutilisés.
Expert parallelism
La stratégie d'entraînement distribué et d'inférence consistant à placer différents experts sur différents GPU ; requiert un brassage all-to-all des tokens entre GPU à chaque couche MoE, créant des goulots d'étranglement réseau.

Sources

  1. Mixtral of Experts (Mistral AI, 2023)
  2. DeepSeek-V2 technical report
  3. DeepSeek-V3 technical report (Dec 2024)
  4. Hugging Face MoE explainer blog
  5. xAI Grok-1 model card
  6. SAP Business AI — official product page
  7. arXiv — Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity (Fedus et al., 2021)
  8. arXiv — GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding (2020)
  9. arXiv — DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models (2024)
  10. SAP News Center — TabPFN-3.5-Plus now available in SAP AI Core (2026-09)
  11. Mistral AI — Mixtral of Experts announcement (2023): 47B total / 13B active parameters
  12. SAP Help Portal — Generative AI hub in SAP AI Core (hosted model endpoints)
  13. SAP Help Portal — Metering and pricing for generative AI on SAP AI Core (AI Units)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →