Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache

KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache?

Bei einem Kontext von 32.000 Tokens beansprucht allein der KV-Cache von Llama 3 70B rund 20 GB pro Anfrage — ein Vielfaches der Modellgewichte selbst bei INT8 — womit die KV-Cache-Optimierung der wirkungsvollste einzelne Hebel in der Ökonomie der LLM-Inferenz ist.

Worum es geht

Während autoregressiver LLM-Inferenz müssen die Key- und Value-Tensoren jedes zuvor erzeugten Tokens im GPU-Speicher gehalten werden, damit zukünftige Tokens sie beachten können — der KV-Cache. Bei langen Kontextlängen dominiert der KV-Cache den gesamten Speicherverbrauch: Bei Llama 3 70B mit 32K Kontext beträgt der KV-Cache rund 20 GB pro Anfrage, ein Vielfaches der Modellgewichte selbst bei INT8. KV-Cache-Optimierung ist daher der wirkungsvollste einzelne Bereich in der Ökonomie der LLM-Inferenz — jede Technik hier übersetzt sich direkt entweder in mehr gleichzeitige Nutzer auf derselben GPU oder in längeren Kontext zu denselben Kosten.

Warum es zählt

  • PagedAttention beseitigt Speicherfragmentierung und ermöglicht bis zu 24-fach höheren Durchsatz, indem mehrere Sequenzen sicher überlappt werden — der einzelne größte Fortschritt beim Inferenz-Serving 2023–2024.
  • KV-Quantisierung auf INT8 halbiert den Cache-Speicher bei unter 1 % Qualitätsverlust; INT4 viertelt ihn bei 2–3 % Verlust.
  • Prefix-Caching nutzt den KV-Zustand eines geteilten Prompt-Präfixes über Anfragen hinweg wieder und liefert bei Chatbot-Workloads mit gemeinsamem System-Prompt oft einen 5- bis 10-fachen Durchsatzgewinn.

Kernpunkte

  • Der KV-Cache (im GPU-Speicher gehaltene K- und V-Tensoren pro Token für zukünftige Attention) dominiert den Speicher bei langem Kontext — Llama 3 70B bei 32K Kontext = ~20 GB KV-Cache pro Anfrage.
  • PagedAttention (vLLM, 2023) — seitentabellenartige KV-Allokation beseitigt Fragmentierung, 24-fache Durchsatzverbesserung; inzwischen Standard in vLLM, TensorRT-LLM, SGLang.
  • KV-Quantisierung — INT8 halbiert den Speicher bei <1 % Qualitätsverlust, INT4 viertelt ihn bei ~2–3 % Verlust; Standard in modernen Serving-Stacks.
  • MQA (ein K/V über alle Heads) und GQA (gruppierte Heads teilen sich K/V, verwendet in Llama 2/3, Mistral, Mixtral) verkleinern den KV-Cache auf Architekturebene um das 4- bis 8-Fache.
  • Prefix-/Speculative-Caching — cacht den KV-Zustand eines geteilten Prompt-Präfixes einmal und nutzt ihn über Anfragen hinweg wieder; 5- bis 10-facher Durchsatzgewinn bei Chatbot-Workloads mit gemeinsamem System-Prompt.
  • „KV-Cache-Optimierung — PagedAttention, quantisierter KV, Speculative Cache" ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Steuerungsmodell, bevor Sie das Tool demonstrieren.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

KV-Cache
Die gecachten Key- und Value-Tensoren aller zuvor erzeugten Tokens, im GPU-Speicher gehalten, damit zukünftige Tokens sie während autoregressiver Inferenz beachten können; dominiert den Speicherverbrauch bei langen Kontextlängen.
PagedAttention
Eine von vLLM (Kwon et al., 2023) eingeführte Inferenz-Serving-Technik, die den KV-Cache in Blöcken fester Größe wie Betriebssystem-Speicherseiten allokiert, Fragmentierung beseitigt und einen 24-fach höheren Durchsatz als naive zusammenhängende Allokation ermöglicht.
Grouped-Query Attention (GQA)
Eine Attention-Architekturvariante, bei der Gruppen von Query-Heads sich einen einzigen Satz K/V-Tensoren teilen (z. B. 8 K/V-Gruppen für 32 Query-Heads); verwendet in Llama 2/3, Mistral, Mixtral und liefert eine 4- bis 8-fache KV-Cache-Reduktion bei nahezu keinem Qualitätsverlust.
Multi-Query Attention (MQA)
Eine extreme Attention-Variante, bei der sich alle Query-Heads einen einzigen K- und V-Tensor teilen; reduziert den KV-Cache um H (Anzahl der Heads, typischerweise 32–128), jedoch mit messbarem Qualitätsverlust gegenüber GQA.
Prefix-Caching
Eine Inferenzoptimierung, die den KV-Cache eines geteilten Prompt-Präfixes einmal speichert und über alle Anfragen wiederverwendet, die dieses Präfix teilen; kanonisch bei Chatbot-Workloads mit gemeinsamem System-Prompt; typischerweise 5- bis 10-facher Durchsatzgewinn.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control Plane
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.

Quellen

  1. Efficient Memory Management for Large Language Model Serving with PagedAttention (Kwon et al., 2023)
  2. GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints (Ainslie et al., 2023)
  3. Fast Transformer Decoding: One Write-Head is All You Need (Shazeer, 2019, MQA)
  4. vLLM documentation — PagedAttention and prefix caching
  5. NVIDIA TensorRT-LLM — KV cache management
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →