Attention-Varianten
Stand 2026-07-24T14:00:00Z
Was ist Attention-Varianten?
Der KV-Cache, nicht die Modellgewichte, ist die bindende Speicherbeschränkung beim produktiven LLM-Serving — klassische Multi-Head-Attention treibt eine einzelne Anfrage bei einem 70B-Modell bei 128K Token auf rund 336 GB, weshalb GQA (8-fache Reduktion) inzwischen der Pareto-optimale Standard ist.
Worum es geht
Attention-Varianten sind die Familie technischer Modifikationen des ursprünglichen Multi-Head-Self-Attention-Mechanismus im Transformer, und die Wahl zwischen ihnen ist wohl der größte einzelne Hebel, den ein Team betätigt, um die Kosten des Betriebs eines großen Sprachmodells im großen Maßstab zu kontrollieren. Herkömmliche Multi-Head-Attention, der im ursprünglichen Transformer-Paper eingeführte Mechanismus, gibt jedem Attention-Head seinen eigenen unabhängigen Satz an Query-, Key- und Value-Projektionen. Dieses Design maximiert den Repräsentationsreichtum des Modells, bedeutet aber auch, dass das Modell während der autoregressiven Generierung für jeden Head, in jeder Schicht, für jedes bereits generierte Token einen Key- und Value-Vektor zwischenspeichern muss — den sogenannten Key-Value-Cache. Bei einem großen Modell mit vielen Heads, einem langen Kontextfenster und einer angemessen großen Batch aus gleichzeitigen Anfragen wird dieser Cache — nicht die Modellgewichte — zur bindenden Beschränkung dafür, wie viel Hardware ein Deployment benötigt und wie viele Nutzer es gleichzeitig bedienen kann.
Warum es zählt
- Die Wahl der Attention-Variante wird als der größte einzelne Hebel für die Inferenzkosten genannt — größer als Quantisierung, Batching oder die Hardware-Stufe in den meisten Deployments.
- Die 8-fache KV-Reduktion von GQA bei einer Qualität, die „mit MHA konkurrenzfähig" ist, ist die konkrete Zahl, die rechtfertigt, warum Llama 3.3 70B H_kv=8 statt vollständiger MHA verwendet.
- PagedAttention eliminiert bis zu 60 % Speicherfragmentierung und hebt die GPU-Auslastung deutlich über die für zusammenhängende Zuweisung typischen ~40 % — ein direkter Kostenhebel für selbst gehostete Inferenz.
Kernpunkte
- Der KV-Cache (nicht die Modellgewichte) ist die bindende GPU-Speicherbeschränkung beim LLM-Serving — MHA bei 128K Kontext benötigt ~336 GB für Llama 3.3 70B; GQA reduziert das 8-fach auf ~42 GB.
- GQA (H_q=64, H_kv=8 bei Llama 3.3 70B) ist das Pareto-Optimum: 8-fache KV-Reduktion bei einer zu MHA konkurrenzfähigen Qualität — seit 2023 der Branchenstandard (Llama 3, Mistral, Gemma 2, Falcon 180B).
- MQA (H_kv=1) maximiert die Speicherersparnis, verschlechtert aber die Qualität bei mehrstufigem Räsonieren — nur für Edge-Deployments mit extrem niedriger Latenz verwenden, bei denen die Regression gemessen und akzeptiert wird.
- FlashAttention-3 erreicht 75 % H100-FLOP-Auslastung gegenüber 35 % bei naivem SDPA — eine orthogonale Kernel-Optimierung ohne jeden Qualitäts-Trade-off, anwendbar zusätzlich zu jeder strukturellen Variante.
- PagedAttention (vLLM, Kwon 2023) virtualisiert den KV-Cache, eliminiert bis zu 60 % Speicherfragmentierung und hebt die GPU-Auslastung im Multi-User-Serving von ~40 % auf ~90 %.
- PyTorch SDPA leitet seit Version 2.0 automatisch an FlashAttention weiter, wenn die Eingaben die Anforderungen des CUDA-Kernels erfüllen — kein explizites Opt-in für PyTorch-basierte Inferenz-Stacks nötig.
- SAP BTP AI Core nutzt eine vLLM-kompatible Serving-Infrastruktur für Open-Weight-Modell-Deployments — die Vorteile von FlashAttention und PagedAttention gelten direkt beim Self-Hosting auf Kyma.
- Für ein 70B-Modell, das 50 gleichzeitige Nutzer bei 4K Kontext auf 4× A100 80GB bedient: GQA + FlashAttention + vLLM (PagedAttention) ist die einzige Konfiguration, die bei akzeptablem Durchsatz in den Speicher passt.
- Multi-head Latent Attention (MLA, DeepSeek-V2 2024) komprimiert den KV-Cache über eine Low-Rank-Projektion weiter — eine aufkommende Variante, noch nicht Mainstream, aber richtungsweisend relevant für sehr lange Kontextszenarien.
- Der Unterschied in der Hardware-Auslastung (FlashAttention: 75 % vs. naiv: 35 %) übersetzt sich direkt in ~2-fachen Durchsatz auf derselben GPU — für einen produktiven Inferenz-Cluster ist das die Software-Optimierung mit dem höchsten verfügbaren ROI.
Begriffe auf dieser Seite
- MHA (Multi-Head Attention)
- Ursprünglicher Attention-Mechanismus (Vaswani 2017): H unabhängige Q-, K-, V-Projektionssätze. Maximale Ausdrucksstärke; maximaler KV-Cache-Speicherbedarf bei langen Kontexten.
- GQA (Grouped-Query Attention)
- Attention-Variante (Ainslie 2023): H_q Query-Heads teilen sich G Gruppen von K/V-Projektionen, wobei H_kv = G < H_q. Aktuelles Pareto-Optimum — 8-fache KV-Reduktion bei zu MHA konkurrenzfähiger Qualität. Standard in Llama 3, Mistral, Gemma 2.
- MQA (Multi-Query Attention)
- Extreme KV-Komprimierung (Shazeer 2019): H_kv=1 — alle Query-Heads teilen sich eine einzige K/V-Projektion. H-fache Speicherersparnis; messbarer Qualitätsverlust bei mehrstufigem Räsonieren. Verwendet in PaLM; in den meisten modernen Modellen durch GQA abgelöst.
- FlashAttention
- IO-bewusste Attention-Implementierung (Dao 2022–2024): kachelt die Q/K/V-Berechnung im SRAM, um wiederholte HBM-Lesezugriffe zu vermeiden. Erreicht O(n) Aktivierungsspeicher statt O(n²), 75 % H100-FLOP-Auslastung gegenüber 35 % naiv. Orthogonal zur Wahl der strukturellen Variante.
- KV cache
- Die zwischengespeicherten Key-Value-Projektionstensoren aus allen vorherigen Attention-Schritten beim autoregressiven Decoding. Der Speicherbedarf skaliert als O(n_layers × H_kv × d_head × seq_len × batch_size) — die bindende GPU-Speicherbeschränkung beim LLM-Serving, nicht die Modellgewichte.
- PagedAttention
- Von virtuellem Speicher inspiriertes KV-Cache-Management (Kwon 2023, vLLM): weist den KV-Cache in nicht zusammenhängenden Seiten mittels betriebssystemartiger Seitentabellen zu. Eliminiert bis zu 60 % Speicherfragmentierung; hebt die GPU-Auslastung im Multi-User-Serving von ~40 % auf ~90 %.
- HBM (High-Bandwidth Memory)
- Der primäre GPU-Speicher (z. B. 80 GB bei A100/H100): langsamer als SRAM, aber deutlich größer. Die zentrale Erkenntnis von FlashAttention ist es, HBM-Lesezugriffe zu minimieren, indem Zwischenergebnisse der Attention-Berechnung im schnelleren On-Chip-SRAM gehalten werden.
- SRAM (on-chip cache)
- Der schnelle On-Chip-Speicher einer GPU (z. B. ~20 MB bei A100, ~256 KB L1 pro SM): um Größenordnungen schneller als HBM, aber weit kleiner. FlashAttention kachelt die Attention-Berechnung so, dass sie in den SRAM passt, und reduziert dadurch die Speicherbandbreitenkosten drastisch.
Quellen
- Vaswani et al. 2017 — Attention Is All You Need
- Shazeer 2019 — Fast Transformer Decoding: One Write-Head is All You Need (MQA)
- Ainslie et al. 2023 — GQA: Training Generalised Multi-Query Transformer Models
- Dao et al. 2023 — FlashAttention-2
- Shah et al. 2024 — FlashAttention-3: Fast and Accurate Attention on Hopper GPUs
- Kwon et al. 2023 — Efficient Memory Management for LLM Serving with PagedAttention
- Meta AI — Llama 3 Model Card
- vLLM documentation — PagedAttention and serving architecture
- PyTorch documentation — scaled_dot_product_attention and FlashAttention dispatch
- SAP BTP AI Core — Generative AI Hub documentation
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.