AI & Analytics Legends Die Wissensplattform für SAP Analytics
Academy-Modul

LLM-Interna für SAP-Architekten — Attention, Positionskodierung, langer Kontext und Mixture-of-Experts

LLM-Interna für SAP-Architekten — Attention, Positionskodierung, langer Kontext und Mixture-of-Experts — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-10-04

Öffnet das Modell hinter SAPs Generative AI Hub für Architekten, die es bereits nutzen. Es lehrt skalierte Skalarprodukt-Attention und den KV-Cache, Grouped-Query-Attention, Rotary Position Embeddings und darauf aufbauende Kontexterweiterungen, die Lücke zwischen angegebenem und effektivem Kontext (Lost in the Middle, RULER), Sliding-Window- und Sparse-Attention sowie Mixture-of-Experts-Routing (Mixtral, DeepSeek-V3), jeweils verknüpft mit einer Konsequenz: Zeit bis zum ersten Token, Speicher pro Nutzer, abgerechnete Tokens, Auslaufdaten und Rate-Limits. Das Labor macht aus den dokumentierten Modellerkennungs-Feldern und dem Messbeispiel von SAP AI Core ein Dimensionierungsblatt für einen Datasphere-gestützten Assistenten, mit einem Positionstest auf Ihren eigenen Daten.

Was Sie lernen

  • Skalierte Skalarprodukt-Attention, Multi-Head-Attention und den KV-Cache so erklären, dass sich ableiten lässt, wie die Prompt-Länge Zeit bis zum ersten Token und Speicher bestimmt
  • Die KV-Cache-Größe eines Modells aus Schichtzahl, Key-Value-Heads und Head-Dimension berechnen und zeigen, was Grouped-Query-Attention ändert
  • Beschreiben, wie Rotary Position Embeddings die relative Position kodieren, warum Modelle jenseits ihrer Trainingslänge scheitern und was Positionsinterpolation und YaRN dagegen tun
  • Das angegebene Kontextfenster mit Lost in the Middle und RULER vom effektiven Fenster trennen und ein Prompt-Budget entsprechend entwerfen
  • Sliding-Window- und Sparse-Attention sowie Mixture-of-Experts-Routing erklären und benennen, welche Kosten sie senken (Rechenaufwand pro Token) und welche nicht (Speicher für alle Experten)
  • Die Modellerkennungs-Felder von SAP AI Core (contextLength, inputCost, outputCost, retirementDate), die Messseite und die Rate-Limit-Seite lesen und daraus eine Dimensionierungsentscheidung für einen Datasphere-gestützten Assistenten ableiten

Modulüberblick

Für wen dieses Modul ist. Sie nutzen bereits den SAP Generative AI Hub: Sie haben in einer Orchestrierungskonfiguration einen Modellnamen gewählt, einen 429 gesehen und sich über eine Token-Rechnung gewundert. Dieses Modul öffnet die Kiste eine Ebene tiefer. Es erklärt die fünf Mechanismen, die bestimmen, was ein großes Sprachmodell lesen kann, wie schnell es antwortet und was es kostet: Attention, Positionskodierung, Kontextfenster, Key-Value-Cache und Mixture-of-Experts-Routing. Vorausgesetzt wird M333 (KI- und LLM-Grundlagen für SAP-Berater); hilfreich sind M325 (Generative AI Hub in der Praxis) und M365 (LLM-Kostensteuerung). Das Modul lehrt Sie, eine Modellkarte, ein contextLength-Feld und eine Latenzkurve wie ein Architekt zu lesen. Primärquellen sind die Originalarbeiten auf arXiv und die Dokumentation der Anbieter; jeder Mechanismus endet in einer Konsequenz, die Sie im SAP-Projekt nutzen können.

Voraussetzungen

  • Abschluss von M333 (KI- und LLM-Grundlagen für SAP-Berater) oder gleichwertige Kenntnisse zu Tokens, Embeddings und Kontext
  • Grundlagen der linearen Algebra (Skalarprodukt, Matrixmultiplikation) und Routine im Lesen einer Modellkarte oder eines kurzen arXiv-Abstracts
  • Optional: ein SAP-AI-Core-Tenant mit dem erweiterten Plan (Generative AI Hub) für den Modellerkennungs-Aufruf im Labor; sonst die Feldbeschreibungen der SAP-Dokumentation nutzen

Lernergebnisse

  • Aus Prompt-Länge und Modellform vorhersagen, ob eine Anfrage langsam startet, langsam streamt oder durch Speicher begrenzt ist, und den verursachenden Mechanismus benennen.
  • Einen KV-Cache und ein monatliches Token-Volumen für einen geerdeten Assistenten dimensionieren und die Zahlen mit den dokumentierten SAP-Feldern belegen.
  • Ein Prompt-Budget und einen Positionstest entwerfen, die die Lücke zwischen angegebenem und effektivem Kontext sichtbar machen.
  • Einem Kunden erklären, warum ein Mixture-of-Experts-Modell pro Token günstig und im Hosting teuer sein kann, ohne einen von SAP nicht veröffentlichten Preis zu nennen.
  • Mit Belegen zwischen Aggregation in der Datenschicht, weniger Chunks und einem größeren Fenster entscheiden.

Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.

In der App öffnen →