Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention
Stand 2026-07-23
Was ist Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention?
Der Wechsel von MHA zu GQA-8 bei gleicher Modellgröße senkt den KV-Cache-Speicherbedarf um etwa das 8-Fache bei unter 1 % MMLU-Verlust und verdoppelt bis verdreifacht die Zahl der gleichzeitigen Nutzer, die eine H100 bedienen kann — der eigentliche Grund, warum Mistral und Llama 3 günstiger bereitstellen als vergleichbare MHA-Modelle.
Worum es geht
Multi-Head Attention (MHA), Grouped-Query Attention (GQA) und Multi-Query Attention (MQA) sind drei Punkte auf derselben Trade-off-Kurve: Wie viele unterschiedliche Key/Value-Projektionen berechnet jede Schicht bei einer festen Anzahl von Query-Heads. Die Wahl ändert nicht, was ein Modell ausdrücken kann; sie ändert, wie viel KV-Cache-Speicher die Inferenz pro Token verbraucht, und damit die Kosten pro Anfrage sowie die maximale Nebenläufigkeit, die eine gegebene GPU bedienen kann.
Warum es existiert. Der ursprüngliche Transformer (2017) nutzte MHA — jeder Query-Head hat seinen eigenen Key- und Value-Head. Das verdoppelt die repräsentative Vielfalt, verdoppelt aber auch den KV-Cache-Speicher bei der Inferenz, was bei langem Kontext die dominierende Speicherkostenart ist (verwandtes Konzept C160). MQA (Shazeer 2019) reduziert alle Heads auf ein einziges gemeinsames K/V — minimaler KV-Speicher, aber ein messbarer Qualitätsverlust bei großem Maßstab. GQA (Ainslie et al. 2023) ist der praktische Kompromiss, den jedes Frontier-Modell seit Llama 2 übernommen hat.
Warum es zählt
- MHA (Llama 1 70B: 64 Q, 64 KV) maximiert die repräsentative Vielfalt, verdoppelt aber den KV-Cache-Speicher gegenüber den Alternativen; MQA reduziert auf einen gemeinsamen K/V-Head mit einem messbaren Qualitätsverlust bei großem Maßstab.
- GQA (Llama 3 70B: 64 Q, 8 KV) ist der praktische Kompromiss, den jedes Frontier-Modell seit Llama 2 übernommen hat.
- Wer über SAP AI Core selbst hostet oder fine-tuned, für den bestimmt diese eine architektonische Wahl die tragfähige Nebenläufigkeit pro GPU — unsichtbar für einen Nutzer einer gehosteten API, aber essenziell, um zu verstehen, warum manche Modelle günstiger bereitzustellen sind.
Kernpunkte
- Drei Punkte auf einer Kurve — MHA (n_kv = n_q), GQA (n_kv = n_q / g), MQA (n_kv = 1) — KV-Speicher gegen Qualität eingetauscht.
- GQA-8 (8 Q-Heads pro KV-Paar) ist der Standard für Llama 3/4, Mistral 7B/Large, Mixtral 8x7B, Gemma 2 — ~8-fache KV-Speicherreduktion gegenüber MHA, <1 % MMLU-Verlust.
- MQA (n_kv = 1) maximiert die Speicherersparnis, verschlechtert aber die Multi-Task-Qualität; nach 2023 selten in Frontier-Modellen eingesetzt.
- KV-Cache-Speicher bei der Inferenz = 2 · n_layers · n_kv · d_head · seq_len · batch · bytes — n_kv ist der dominierende Hebel.
- Der Erhalt der Qualität erfordert GQA-Training von Grund auf oder sorgfältiges 'Uptraining' von einem MHA-Checkpoint aus (Ainslie 2023).
- Multi-Head Attention vs. Grouped-Query Attention vs. Multi-Query Attention ist erst beherrscht, wenn sie die Entscheidung eines konkret benannten Buyers verändert.
- Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
- Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
- Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.
- Vor dem Skalieren Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback festlegen.
Begriffe auf dieser Seite
- n_q / n_kv
- Die Anzahl der Query-Heads (n_q) und Key/Value-Heads (n_kv) in einer Transformer-Schicht. MHA hat n_kv = n_q; GQA hat n_kv < n_q; MQA hat n_kv = 1.
- KV-Cache
- Der pro Anfrage geführte Speicher berechneter Key- und Value-Tensoren für alle vergangenen Token, der bei jedem Generierungsschritt wiederverwendet wird, um Neuberechnung zu vermeiden. Dominiert den GPU-Speicher bei langem Kontext.
- Uptraining
- Das Verfahren (Ainslie et al. 2023) zur Umwandlung eines bestehenden MHA-Checkpoints in ein GQA-Modell mit einer geringen Menge zusätzlichen Trainings, wobei der Großteil der ursprünglichen Qualität zu einem Bruchteil der Kosten eines Trainings von Grund auf erhalten bleibt.
- Nebenläufigkeit
- Die Anzahl gleichzeitiger Nutzersitzungen, die ein fester GPU-Pool bei der Ziel-Latenz bedienen kann. Umgekehrt proportional zum KV-Cache-Speicher pro Sitzung — der zentrale Business-KPI, den GQA verbessert.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.
Quellen
- Ainslie et al. — GQA: Training Generalized Multi-Query Transformer Models (2023)
- Meta AI — Llama 3 Model Card and Architecture Notes
- Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.