Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention

Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention?

Der Wechsel von MHA zu GQA-8 bei gleicher Modellgröße senkt den KV-Cache-Speicherbedarf um etwa das 8-Fache bei unter 1 % MMLU-Verlust und verdoppelt bis verdreifacht die Zahl der gleichzeitigen Nutzer, die eine H100 bedienen kann — der eigentliche Grund, warum Mistral und Llama 3 günstiger bereitstellen als vergleichbare MHA-Modelle.

Worum es geht

Multi-Head Attention (MHA), Grouped-Query Attention (GQA) und Multi-Query Attention (MQA) sind drei Punkte auf derselben Trade-off-Kurve: Wie viele unterschiedliche Key/Value-Projektionen berechnet jede Schicht bei einer festen Anzahl von Query-Heads. Die Wahl ändert nicht, was ein Modell ausdrücken kann; sie ändert, wie viel KV-Cache-Speicher die Inferenz pro Token verbraucht, und damit die Kosten pro Anfrage sowie die maximale Nebenläufigkeit, die eine gegebene GPU bedienen kann.

Warum es existiert. Der ursprüngliche Transformer (2017) nutzte MHA — jeder Query-Head hat seinen eigenen Key- und Value-Head. Das verdoppelt die repräsentative Vielfalt, verdoppelt aber auch den KV-Cache-Speicher bei der Inferenz, was bei langem Kontext die dominierende Speicherkostenart ist (verwandtes Konzept C160). MQA (Shazeer 2019) reduziert alle Heads auf ein einziges gemeinsames K/V — minimaler KV-Speicher, aber ein messbarer Qualitätsverlust bei großem Maßstab. GQA (Ainslie et al. 2023) ist der praktische Kompromiss, den jedes Frontier-Modell seit Llama 2 übernommen hat.

Warum es zählt

  • MHA (Llama 1 70B: 64 Q, 64 KV) maximiert die repräsentative Vielfalt, verdoppelt aber den KV-Cache-Speicher gegenüber den Alternativen; MQA reduziert auf einen gemeinsamen K/V-Head mit einem messbaren Qualitätsverlust bei großem Maßstab.
  • GQA (Llama 3 70B: 64 Q, 8 KV) ist der praktische Kompromiss, den jedes Frontier-Modell seit Llama 2 übernommen hat.
  • Wer über SAP AI Core selbst hostet oder fine-tuned, für den bestimmt diese eine architektonische Wahl die tragfähige Nebenläufigkeit pro GPU — unsichtbar für einen Nutzer einer gehosteten API, aber essenziell, um zu verstehen, warum manche Modelle günstiger bereitzustellen sind.

Kernpunkte

  • Drei Punkte auf einer Kurve — MHA (n_kv = n_q), GQA (n_kv = n_q / g), MQA (n_kv = 1) — KV-Speicher gegen Qualität eingetauscht.
  • GQA-8 (8 Q-Heads pro KV-Paar) ist der Standard für Llama 3/4, Mistral 7B/Large, Mixtral 8x7B, Gemma 2 — ~8-fache KV-Speicherreduktion gegenüber MHA, <1 % MMLU-Verlust.
  • MQA (n_kv = 1) maximiert die Speicherersparnis, verschlechtert aber die Multi-Task-Qualität; nach 2023 selten in Frontier-Modellen eingesetzt.
  • KV-Cache-Speicher bei der Inferenz = 2 · n_layers · n_kv · d_head · seq_len · batch · bytes — n_kv ist der dominierende Hebel.
  • Der Erhalt der Qualität erfordert GQA-Training von Grund auf oder sorgfältiges 'Uptraining' von einem MHA-Checkpoint aus (Ainslie 2023).
  • Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention ist erst beherrscht, wenn sie die Entscheidung eines konkret benannten Buyers verändert.
  • Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
  • Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
  • Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.
  • Vor dem Skalieren Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback festlegen.

Begriffe auf dieser Seite

n_q / n_kv
Die Anzahl der Query-Heads (n_q) und Key/Value-Heads (n_kv) in einer Transformer-Schicht. MHA hat n_kv = n_q; GQA hat n_kv < n_q; MQA hat n_kv = 1.
KV-Cache
Der pro Anfrage geführte Speicher berechneter Key- und Value-Tensoren für alle vergangenen Token, der bei jedem Generierungsschritt wiederverwendet wird, um Neuberechnung zu vermeiden. Dominiert den GPU-Speicher bei langem Kontext.
Uptraining
Das Verfahren (Ainslie et al. 2023) zur Umwandlung eines bestehenden MHA-Checkpoints in ein GQA-Modell mit einer geringen Menge zusätzlichen Trainings, wobei der Großteil der ursprünglichen Qualität zu einem Bruchteil der Kosten eines Trainings von Grund auf erhalten bleibt.
Nebenläufigkeit
Die Anzahl gleichzeitiger Nutzersitzungen, die ein fester GPU-Pool bei der Ziel-Latenz bedienen kann. Umgekehrt proportional zum KV-Cache-Speicher pro Sitzung — der zentrale Business-KPI, den GQA verbessert.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.

Quellen

  1. Ainslie et al. — GQA: Training Generalized Multi-Query Transformer Models (2023)
  2. Meta AI — Llama 3 Model Card and Architecture Notes
  3. Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
  4. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  5. SAP News Center — SAP Unveils the Autonomous Enterprise
  6. SAP News Center — The Future of the Enterprise Is Autonomous
  7. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  8. SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. arXiv — preprint archive (cs.CL/cs.AI)
  23. HuggingFace — model hub
  24. Gartner — research & analyst site
  25. BARC — BI & Analytics research
  26. TDWI — data & analytics research
  27. DSAG — German-speaking SAP user group
  28. ASUG — Americas' SAP User Group
  29. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →