AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Attention Multi-Têtes vs Grouped-Query vs Multi-Query

Attention Multi-Têtes vs Grouped-Query vs Multi-Query — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Attention Multi-Têtes vs Grouped-Query vs Multi-Query : quelle est la différence ?

Passer de MHA à GQA-8 à taille de modèle égale réduit la mémoire de cache KV d'environ 8× pour moins de 1 % de perte MMLU, doublant ou triplant le nombre d'utilisateurs concurrents qu'une H100 peut servir — la vraie raison pour laquelle Mistral et Llama 3 servent moins cher que des modèles MHA équivalents.

De quoi il s'agit

L'attention multi-têtes (MHA), Grouped-Query Attention (GQA) et Multi-Query Attention (MQA) sont trois points sur la même courbe d'arbitrage : combien de projections Key/Value distinctes chaque couche calcule-t-elle, pour un nombre fixé de têtes Query. Le choix ne modifie pas ce que le modèle peut exprimer; il modifie la mémoire de cache KV que l'inférence consomme par token, et donc le coût par requête et la concurrence maximale qu'un GPU donné peut servir.

Pourquoi cela existe. Le Transformer original (2017) utilisait MHA — chaque tête Query a ses propres têtes Key et Value. Cela double la diversité représentationnelle mais double aussi la mémoire de cache KV à l'inférence, qui est le coût dominant en long contexte (concept compagnon C160). MQA (Shazeer 2019) effondre toutes les têtes vers un unique K/V partagé — mémoire KV minimale, mais perte de qualité mesurable à l'échelle. GQA (Ainslie et al. 2023) est le compromis pratique adopté par tous les modèles de frontière depuis Llama 2.

Pourquoi c'est important

  • MHA (Llama 1 70B : 64 Q, 64 KV) maximise la diversité représentationnelle mais double la mémoire de cache KV par rapport aux alternatives; MQA effondre vers une seule tête K/V partagée avec une perte de qualité mesurable à l'échelle.
  • GQA (Llama 3 70B : 64 Q, 8 KV) est le compromis pratique adopté par tous les modèles de frontière depuis Llama 2.
  • Si vous auto-hébergez ou fine-tunez via SAP AI Core, ce seul choix architectural contrôle la concurrence soutenable par GPU — invisible pour un consommateur d'API hébergée, mais essentiel pour comprendre pourquoi certains modèles coûtent moins cher à servir.

Points clés

  • Trois points sur une courbe — MHA (n_kv = n_q), GQA (n_kv = n_q / g), MQA (n_kv = 1) — arbitrage mémoire KV contre qualité.
  • GQA-8 (8 têtes Q par paire KV) est le défaut pour Llama 3/4, Mistral 7B/Large, Mixtral 8x7B, Gemma 2 — réduction mémoire KV ~8× vs MHA, perte MMLU <1 %.
  • MQA (n_kv = 1) maximise les économies de mémoire mais dégrade la qualité multi-tâche ; rarement utilisé dans les modèles de frontière post-2023.
  • Mémoire cache KV à l'inférence = 2 · n_layers · n_kv · d_head · seq_len · batch · octets — n_kv est le levier dominant.
  • Préserver la qualité exige un entraînement GQA from-scratch ou un « uptraining » soigné depuis un checkpoint MHA (Ainslie 2023).
  • GQA est devenu le défaut même pour les modèles de frontière fermés dont l'architecture exacte n'est pas divulguée — la configuration de têtes de Claude n'est pas confirmée publiquement, mais son économie de service est cohérente avec une conception de la famille GQA.
  • La Multi-Head Latent Attention (MLA), introduite dans DeepSeek-V2 (2024), compresse K/V dans un vecteur latent partagé de rang faible, poussant la réduction du cache KV plus loin que GQA-8 à qualité comparable — la frontière de cette même courbe.
  • Sur SAP AI Core, le choix MHA/GQA/MQA est invisible pour tout modèle servi comme point de terminaison géré du generative AI hub ; il ne devient une vraie décision de conseil que lors de l'auto-hébergement ou de l'affinage d'un checkpoint ouvert.

Termes employés sur cette page

n_q / n_kv
Le nombre de têtes Query (n_q) et de têtes Key/Value (n_kv) dans une couche Transformer. MHA a n_kv = n_q ; GQA a n_kv < n_q ; MQA a n_kv = 1.
KV cache
Le stockage mémoire, par requête, des tenseurs Key et Value déjà calculés pour tous les tokens passés, réutilisé à chaque étape de génération pour éviter le recalcul. Domine la mémoire GPU en contexte long.
Uptraining
La procédure (Ainslie et al. 2023) pour convertir un checkpoint MHA existant en modèle GQA avec une faible quantité d'entraînement supplémentaire, préservant l'essentiel de la qualité d'origine pour une fraction du coût d'un entraînement from-scratch.
Concurrency
Le nombre de sessions utilisateur simultanées qu'un pool GPU fixe peut servir à la latence cible. Inversement proportionnel à la mémoire du KV cache par session — le KPI métier clé que GQA améliore.
Ratio de têtes d'attention (Q:KV)
Le seul chiffre (n_q divisé par n_kv) qui prédit la mémoire d'inférence et la concurrence de façon plus fiable que le nombre total de paramètres ; à demander explicitement dans toute fiche de modèle ouvert ou tout appel d'offres d'auto-hébergement.
AI Units (SAP)
L'unité de tarification mesurée de SAP pour la consommation d'IA Premium sur le generative AI hub ; masque au client la configuration n_kv du modèle sous-jacent, ce qui explique pourquoi le comportement de coût d'un déploiement auto-hébergé peut surprendre une équipe habituée à la tarification des points de terminaison hébergés.
Multi-Head Latent Attention (MLA)
Une compression allant plus loin que GQA, introduite dans DeepSeek-V2 (2024) : les clés et valeurs sont projetées dans un vecteur latent partagé de rang faible avant mise en cache, réduisant encore plus la mémoire du cache KV que GQA-8 à qualité comparable — la frontière actuelle de la courbe mémoire-qualité que décrit cette fiche.

Sources

  1. Ainslie et al. — GQA: Training Generalized Multi-Query Transformer Models (2023)
  2. Meta AI — Llama 3 Model Card and Architecture Notes
  3. Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
  4. SAP Generative AI — official product page
  5. arXiv — Fast Transformer Decoding: One Write-Head is All You Need (Shazeer, 2019 — origin of MQA)
  6. Mistral AI — Announcing Mistral 7B (2023): confirms GQA + sliding window attention
  7. SAP Help Portal — Generative AI hub in SAP AI Core (hosted model endpoints)
  8. SAP Help Portal — Metering and pricing for generative AI on SAP AI Core (AI Units)
  9. Databricks — Model Serving documentation (self-hosting open-weight checkpoints)
  10. arXiv — FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (Dao et al., 2022)
  11. SAP — AI Units pricing page (Premium AI consumption model)
  12. arXiv — DeepSeek-V2: introduces Multi-Head Latent Attention (MLA) (2024)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →