Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Attention-Mechanismus — vom Scaled Dot-Product zum Produktiveinsatz

Attention-Mechanismus — vom Scaled Dot-Product zum Produktiveinsatz — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Attention-Mechanismus — vom Scaled Dot-Product zum Produktiveinsatz?

Attention ersetzte Rekurrenz und Convolution, indem sie jede Token-Paar-Interaktion in einem parallelen Schritt berechnet — doch genau dieses Design ist O(n²) in der Sequenzlänge, weshalb jede moderne Variante (FlashAttention, GQA, Sliding Window) existiert, um diese Kosten abzumildern.

Worum es geht

Attention ist der Mechanismus, der es jedem Token in einer Sequenz erlaubt, in einer einzigen parallelen Berechnung zu entscheiden, welche anderen Token für es wichtig sind und in welchem Maß. Er löste Rekurrenz und Convolution als dominierendes Sequenzmodellierungs-Primitiv nach dem 2017er Paper „Attention Is All You Need" ab, und jedes für Anwender relevante Modell, das ein Berater zitieren wird — GPT, Claude, Gemini, Llama, Mistral —, ist ein Stapel von Attention-Schichten, umhüllt von Feed-Forward-Blöcken. Es zu verstehen ist für einen SAP-Analytics-Praktiker keine akademische Nebensächlichkeit; es ist das Konzept, das erklärt, warum langer Kontext teuer ist, warum die GPU-Dimensionierung für ein selbst gehostetes Deployment schwierig ist und warum eine Pro-Token-API-Rechnung sich so verhält, wie sie sich verhält.

Warum es zählt

  • Die √dₖ-Skalierung in softmax(QKᵀ/√dₖ) existiert speziell, um zu verhindern, dass Skalarprodukte bei hoher Embedding-Dimension die Softmax sättigen.
  • Causal Masking in Decodern setzt die Attention zu zukünftigen Token auf null — der mechanische Grund, warum autoregressive Generierung Token für Token funktioniert.
  • Die O(n²·d)-Kosten sind der direkte Treiber der Pro-Token-Rechnung eines Joule-Deployments — das Tuning der Kontextlänge oder das Debugging der Latenz bedeutet, die Attention-Kosten zu tunen.

Kernpunkte

  • Scaled-Dot-Product-Formel — softmax(Q·Kᵀ / √dₖ)·V — drei Projektionen pro Token, eine softmax-gewichtete Summe.
  • √dₖ-Skalierung verhindert Softmax-Sättigung bei hoher Embedding-Dimension; ohne sie verschwinden die Gradienten bei großen Modellen.
  • Die Kosten liegen sowohl bei Compute als auch bei Speicher bei O(n²·d) — quadratisch in der Sequenzlänge n, linear in der Head-Dimension d.
  • Die Causal Mask in Decodern setzt die Attention zu zukünftigen Token auf null und erzwingt eine Generierung von links nach rechts.
  • Jede LLM-Optimierung seit 2017 (FlashAttention, GQA, MQA, Sliding Window, Sparse) greift die O(n²)-Wand an.
  • Attention-Mechanismus — vom Scaled Dot-Product zum Produktiveinsatz ist erst beherrscht, wenn er die Entscheidung eines konkret benannten Buyers verändert.
  • Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
  • Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
  • Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.
  • Vor dem Skalieren Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback festlegen.

Begriffe auf dieser Seite

Query / Key / Value (Q, K, V)
Drei lineare Projektionen jedes Input-Token-Embeddings. Q stellt die Frage ('wonach suche ich?'), K bietet die Antwort an ('was enthalte ich?'), V trägt die Nutzlast, die in die Ausgabe eingemischt wird.
Softmax
Die Normalisierungsfunktion, die rohe Skalarprodukt-Werte in eine Wahrscheinlichkeitsverteilung über Token umwandelt. Sättigt (Gradienten verschwinden), wenn die Eingaben zu groß sind — der Grund für die √dₖ-Skalierung.
Causal Mask
Eine dreieckige Maske, die vor der Softmax in reinen Decoder-Modellen angewendet wird, sodass jede Position nur auf sich selbst und frühere Positionen zugreift; erzwingt autoregressive Generierung von links nach rechts.
Head-Dimension (dₖ)
Die Größe der Q/K/V-Vektoren jedes Attention-Heads. Typische Werte 64 oder 128; die gesamte Modell-Embedding-Dimension = Anzahl Heads × dₖ.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.

Quellen

  1. Vaswani et al. — Attention Is All You Need (NeurIPS 2017)
  2. Stanford CS25 — Transformers United (lecture notes 2024-2026)
  3. AI inference just plays by different rules — The Register, 2026-05-04
  4. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  5. SAP News Center — SAP Unveils the Autonomous Enterprise
  6. SAP News Center — The Future of the Enterprise Is Autonomous
  7. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  8. SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →