Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

LLM-Kostenengineering auf SAP — AI Units, Token-Budgets, Caching

LLM-Kostenengineering auf SAP — AI Units, Token-Budgets, Caching — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-09-25

Was ist LLM-Kostenengineering auf SAP?

C128 und C333 erklären, wie SAP generative KI-Ausgaben zuordnet und bepreist; diese Karte ist das Praktiker-Werkzeug, um sie zu senken — explizites Prompt Caching (nur Anthropic Claude und Amazon Nova, Standard-TTL fünf Minuten), Batch Consumption für native LLM-Massenaufrufe zu dokumentiert niedrigeren Kosten als synchrone Aufrufe, sowie die Token-Budget- und Rate-Limit-Einstellungen, die aus einem offenen Modellaufruf einen begrenzten machen.

Wo Kostenengineering neben Kostenzuordnung steht

C128 behandelt, wie SAP-AI-Core-Ausgaben zugeordnet werden — Token zu GenAI-Token zu Kapazitätseinheiten, Resource-Group-Granularität, die Labels, die Sie für die Kostenverrechnung hinzufügen. C333 behandelt die kommerziellen Schichten, in denen Joule und eingebettete KI stehen — AI Units, Preise pro Agent-Aktion. Keine der beiden handelt davon, die Rechnung selbst zu senken; das ist Aufgabe dieser Karte. Die von beiden Karten beschriebene Abrechnungskette bleibt der Ausgangspunkt: Eingabe- und Ausgabe-Token (Ausgabe etwas teurer) werden zu modellabhängigen Sätzen, die SAP in SAP-Hinweis 3437766 dokumentiert, in GenAI-Token umgerechnet, und GenAI-Token werden zu den Kapazitätseinheiten auf der Rechnung. Jeder Hebel unten wirkt irgendwo auf dieser Kette — indem er Token ganz vermeidet (Caching), die synchrone Prämie vermeidet (Batching) oder die Token begrenzt, die ein Aufruf ausgeben darf (Budgets und Limits).

Warum es zählt

  • Eine RAG-Pipeline mit einem langen, statischen System-Prompt ohne cache_control zahlt bei jedem einzelnen Aufruf den vollen Preis für dieses Präfix — bei Claude- oder Nova-Modellen ist das ein komplett liegengelassener Rabatt.
  • Einen nächtlichen Massen-Klassifizierungsjob über die Orchestrierung statt über Batch Consumption laufen zu lassen, kostet laut SAPs eigener Dokumentation sowohl mehr als auch fügt clientseitiges Rate-Limit-Handling hinzu, das Batch Consumption nicht braucht.
  • Ein ungesetztes max_completion_tokens ist kein sicherer Standard — es autorisiert still das eigene Maximum des Modells, genau die Art Detail, die aus der Token-Schätzung eines Piloten eine böse Überraschung auf der Produktionsrechnung macht.

Kernpunkte

  • Abrechnungskette (geteilt mit C128): Eingabe-/Ausgabe-Token -> GenAI-Token (modellabhängiger Satz, SAP-Hinweis 3437766) -> abgerechnete Kapazitätseinheiten.
  • Explizites Prompt Caching (cache_control) funktioniert nur bei Anthropic Claude (bis zu 4 Breakpoints: tools, system, messages) und Amazon Nova (system/messages, ~1 Breakpoint). OpenAI/Gemini erhalten nur implizites, nicht konfigurierbares Caching.
  • Standard-Cache-TTL ist 5 Minuten; ausgewählte Anthropic-Modelle unterstützen eine optionale 1-Stunden-TTL.
  • Batch Consumption ist als günstiger als synchrone Aufrufe dokumentiert, wiederholt automatisch und braucht kein clientseitiges Rate-Limit-Handling — unterstützt aber nur native LLM-Aufrufe, keine Orchestrierung (kein Grounding/Masking/Filtering).
  • Batch Consumption ist auf EU/USA beschränkt, ohne prod-euonly und Sovereign Cloud, und braucht ein Object-Store-Secret (S3, Azure Blob, GCS, Alibaba OSS oder HANA Cloud Data Lake).
  • RPM-Rate-Limits gelten pro Modell und Mandant; ein 429 kostet Latenz und Retry-Risiko, nicht per se zusätzliche Abrechnung — ein höheres Limit senkt die Ausgaben nicht.
  • max_completion_tokens ist bei Anthropic-Modellen Pflicht; bei jedem anderen Modell ungesetzt, wendet die Orchestrierung dessen eigenes Maximum an.
  • Fallback-Listen (config.modules als Array) behandeln 408/429/5xx bei Nicht-Streaming-Aufrufen durch Modellwechsel statt blindem Wiederholen.

Begriffe auf dieser Seite

GenAI-Token
Eine virtuelle Zähleinheit, die modellabhängige Token-Nutzung darstellt und zur Berechnung der Kapazitätseinheiten-Abrechnung dient (SAP-Hinweis 3437766).
cache_control
Das Orchestration-V2-Feld, das einen Prompt-Block als Cache-Breakpoint markiert, nur für Anthropic-Claude- und Amazon-Nova-Modelle unterstützt.
Implizites Caching
Standardmäßiges, nicht konfigurierbares Kontext-Caching für OpenAI- und Gemini-Modelle in der Orchestrierung.
Batch Consumption
Asynchrone Verarbeitung vieler nativer LLM-Anfragen aus einer Datei, dokumentiert als günstiger als synchrone Aufrufe, aber für Orchestrierungsanfragen nicht verfügbar.
RPM-Limit
Eine Obergrenze für Requests Per Minute pro Modell und Mandant; eine Überschreitung liefert HTTP 429.
Fallback-Liste
config.modules als Array übergeben, damit die Orchestrierung bei nicht unterstützter Region oder, ohne Streaming, bei 408/429/5xx das Modell wechselt.

Quellen

  1. SAP AI Core docs (SAP-docs GitHub, Sep 2026) — Prompt Caching (cache_control, supported models, TTL, response fields)
  2. SAP AI Core docs — Batch Consumption (native-LLM-only, regions, object store providers, documented cost reduction)
  3. SAP AI Core docs — Rate Limit Management (RPM per model/tenant, 429, resource-group thresholds)
  4. SAP AI Core docs — Metering and Pricing for Generative AI (tokens, GenAI tokens, capacity units, worked example)
  5. SAP AI Core docs — Orchestration Workflow V2 (model block, max_completion_tokens, timeout, max_retries)

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →