KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache
Stand 2026-07-23
Was ist KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache?
Bei einem Kontext von 32.000 Tokens beansprucht allein der KV-Cache von Llama 3 70B rund 20 GB pro Anfrage — ein Vielfaches der Modellgewichte selbst bei INT8 — womit die KV-Cache-Optimierung der wirkungsvollste einzelne Hebel in der Ökonomie der LLM-Inferenz ist.
Worum es geht
Während autoregressiver LLM-Inferenz müssen die Key- und Value-Tensoren jedes zuvor erzeugten Tokens im GPU-Speicher gehalten werden, damit zukünftige Tokens sie beachten können — der KV-Cache. Bei langen Kontextlängen dominiert der KV-Cache den gesamten Speicherverbrauch: Bei Llama 3 70B mit 32K Kontext beträgt der KV-Cache rund 20 GB pro Anfrage, ein Vielfaches der Modellgewichte selbst bei INT8. KV-Cache-Optimierung ist daher der wirkungsvollste einzelne Bereich in der Ökonomie der LLM-Inferenz — jede Technik hier übersetzt sich direkt entweder in mehr gleichzeitige Nutzer auf derselben GPU oder in längeren Kontext zu denselben Kosten.
Warum es zählt
- PagedAttention beseitigt Speicherfragmentierung und ermöglicht bis zu 24-fach höheren Durchsatz, indem mehrere Sequenzen sicher überlappt werden — der einzelne größte Fortschritt beim Inferenz-Serving 2023–2024.
- KV-Quantisierung auf INT8 halbiert den Cache-Speicher bei unter 1 % Qualitätsverlust; INT4 viertelt ihn bei 2–3 % Verlust.
- Prefix-Caching nutzt den KV-Zustand eines geteilten Prompt-Präfixes über Anfragen hinweg wieder und liefert bei Chatbot-Workloads mit gemeinsamem System-Prompt oft einen 5- bis 10-fachen Durchsatzgewinn.
Kernpunkte
- Der KV-Cache (im GPU-Speicher gehaltene K- und V-Tensoren pro Token für zukünftige Attention) dominiert den Speicher bei langem Kontext — Llama 3 70B bei 32K Kontext = ~20 GB KV-Cache pro Anfrage.
- PagedAttention (vLLM, 2023) — seitentabellenartige KV-Allokation beseitigt Fragmentierung, 24-fache Durchsatzverbesserung; inzwischen Standard in vLLM, TensorRT-LLM, SGLang.
- KV-Quantisierung — INT8 halbiert den Speicher bei <1 % Qualitätsverlust, INT4 viertelt ihn bei ~2–3 % Verlust; Standard in modernen Serving-Stacks.
- MQA (ein K/V über alle Heads) und GQA (gruppierte Heads teilen sich K/V, verwendet in Llama 2/3, Mistral, Mixtral) verkleinern den KV-Cache auf Architekturebene um das 4- bis 8-Fache.
- Prefix-/Speculative-Caching — cacht den KV-Zustand eines geteilten Prompt-Präfixes einmal und nutzt ihn über Anfragen hinweg wieder; 5- bis 10-facher Durchsatzgewinn bei Chatbot-Workloads mit gemeinsamem System-Prompt.
- „KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache" ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Steuerungsmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- KV-Cache
- Die gecachten Key- und Value-Tensoren aller zuvor erzeugten Tokens, im GPU-Speicher gehalten, damit zukünftige Tokens sie während autoregressiver Inferenz beachten können; dominiert den Speicherverbrauch bei langen Kontextlängen.
- PagedAttention
- Eine von vLLM (Kwon et al., 2023) eingeführte Inferenz-Serving-Technik, die den KV-Cache in Blöcken fester Größe wie Betriebssystem-Speicherseiten allokiert, Fragmentierung beseitigt und einen 24-fach höheren Durchsatz als naive zusammenhängende Allokation ermöglicht.
- Grouped-Query Attention (GQA)
- Eine Attention-Architekturvariante, bei der Gruppen von Query-Heads sich einen einzigen Satz K/V-Tensoren teilen (z. B. 8 K/V-Gruppen für 32 Query-Heads); verwendet in Llama 2/3, Mistral, Mixtral und liefert eine 4- bis 8-fache KV-Cache-Reduktion bei nahezu keinem Qualitätsverlust.
- Multi-Query Attention (MQA)
- Eine extreme Attention-Variante, bei der sich alle Query-Heads einen einzigen K- und V-Tensor teilen; reduziert den KV-Cache um H (Anzahl der Heads, typischerweise 32–128), jedoch mit messbarem Qualitätsverlust gegenüber GQA.
- Prefix-Caching
- Eine Inferenzoptimierung, die den KV-Cache eines geteilten Prompt-Präfixes einmal speichert und über alle Anfragen wiederverwendet, die dieses Präfix teilen; kanonisch bei Chatbot-Workloads mit gemeinsamem System-Prompt; typischerweise 5- bis 10-facher Durchsatzgewinn.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Control Plane
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Quellen
- Efficient Memory Management for Large Language Model Serving with PagedAttention (Kwon et al., 2023)
- GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints (Ainslie et al., 2023)
- Fast Transformer Decoding: One Write-Head is All You Need (Shazeer, 2019, MQA)
- vLLM documentation — PagedAttention and prefix caching
- NVIDIA TensorRT-LLM — KV cache management
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.