KI-Kostenzuordnung — Model-Gateway-Abrechnung pro Szenario
Stand 2026-07-24T14:00:00Z
Was ist KI-Kostenzuordnung — Model-Gateway-Abrechnung pro Szenario?
Eine einzelne Interaktion wie „Fasse mein Meeting zusammen" kann unbemerkt drei verkettete Modellaufrufe mit insgesamt 8.500-23.600 Token auslösen – bei 100 Nutzern vernachlässigbar, aber bei 10.000 Nutzern mit 20 Interaktionen täglich 290.000-875.000 € pro Jahr.
Worum es geht
Das Model Gateway von SAP AI Core ist die verwaltete Inferenzschicht, durch die jede Joule-Anfrage, jeder generative KI-Flow in SAP Build und jeder benutzerdefinierte Aufruf eines großen Sprachmodells auf dem Weg zu einem Modell läuft. Es existiert teils aus Bequemlichkeit — eine Authentifizierungsfläche, eine Retry- und Rate-Limiting-Schicht statt einer eigenen pro Anwendung — und teils zur Kontrolle: Das Gateway ist auch der einzige Messpunkt, den SAP zur Abrechnung des KI-Verbrauchs nutzt. Zu verstehen, wie diese Abrechnung auf der Ebene einzelner Modellaufrufe und Geschäftsszenarien funktioniert, macht den Unterschied zwischen einem KI-Programm, das im Budget bleibt, und einem, das im dritten Monat eine Notfall-Finanzprüfung auslöst, nachdem die Rechnung eingetroffen ist und niemand erklären kann, welches Feature sie verursacht hat.
Wie das Gateway die Nutzung tatsächlich misst. Es sitzt zwischen der aufrufenden Anwendung — Joule, dem Generative AI Hub in Build, einer benutzerdefinierten BTP-Erweiterung — und dem zugrunde liegenden Modell, sei es ein gehostetes Modell der GPT-Klasse, ein Claude-Modell oder ein Open-Weights-Modell, das auf SAPs eigener Infrastruktur läuft. Der Aufrufer hält niemals direkt Zugangsdaten zum zugrunde liegenden Modell; das Gateway übernimmt Authentifizierung, Rate Limiting und Nutzungsverfolgung. Die Abrechnungseinheit ist der Token: Input-Token, also Prompt plus Systemanweisungen plus jeglicher abgerufener Knowledge-Graph-Kontext, und Output-Token, also das, was das Modell generiert. Unterschiedliche Modellstufen tragen unterschiedliche Preise pro Token, und Enterprise-Verträge bündeln typischerweise ein monatliches Token-Kontingent über alle Modelle hinweg, mit Mehrverbrauchsgebühren, sobald dieses Kontingent ausgeschöpft ist.
Warum es zählt
- Eine einzelne Nutzeranfrage kann sich in einen RAG-Aufruf, einen Zusammenfassungsaufruf und einen Formatierungsaufruf zerlegen — drei abgerechnete Inferenzen, nicht eine
- Die Kosten pro Interaktion (0,004-0,012 €) wirken trivial, bis man sie mit der Skalierung multipliziert: 10.000 Nutzer × 20 Interaktionen/Tag = 800-2.400 €/Tag
- Das Verständnis dieser Szenario-Zerlegung ist es, was ein KI-Programm, das im Budget bleibt, von einem unterscheidet, das im dritten Monat eine Notfallprüfung auslöst
Kernpunkte
- Das Model Gateway ist der verwaltete Inferenz-Router von SAP AI Core — alle Joule-, Build-GenAI- und benutzerdefinierten LLM-Aufrufe werden hier in Token (Input + Output) gemessen.
- Eine einzelne Joule-Interaktion löst 3–4 Modellaufrufe aus (RAG-Retrieval + Zusammenfassung + Formatierung); typischer Token-Bereich 8.500–23.600 Token pro Interaktion.
- Bei 10.000 Nutzern × 20 Interaktionen/Tag impliziert die Preisgestaltung im mittleren Modellsegment 290.000-875.000 €/Jahr — eine Kostenmodellierung vor Go-live ist nicht verhandelbar.
- Die 4 wichtigsten Kostenhebel: Prompt Engineering (statischen Kontext in den KG verlagern), Reduzierung der Chunk-Anzahl per Re-Ranking, Auswahl der Modellstufe (kleines Modell für Klassifizierung), semantisches Caching.
- Nutzen Sie den AI-Core-Header `resource-group`, um den Token-Verbrauch nach Geschäftsbereich zuzuordnen — ohne ihn ist die monatliche KI-Rechnung niemandem zuordenbar.
- Agentische Mehrschritt-Ketten kosten das 15–40-Fache eines Single-Turn-RAG; setzen Sie eine Max-Turns-Obergrenze (4–6 bei Enterprise-Workflows) auf der AI-Core-Orchestrierungsebene.
- Guards für die Eingabelänge verhindern Spitzen durch lange Dokumente (ein 50-seitiger Vertrag = 40.000–80.000 Token in einem Aufruf).
- KI-Kostenzuordnung — Model-Gateway-Abrechnung pro Szenario ist erst beherrscht, wenn sie eine konkret benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und Nachrichtensignale als Beleg, nicht als Dekoration.
Begriffe auf dieser Seite
- Model Gateway
- Der zentralisierte Inferenz-Router von SAP AI Core — übernimmt Authentifizierung, Rate Limiting, Retry und Token-Messung für alle LLM-Aufrufe aus Joule- und BTP-Anwendungen.
- Token
- Die Abrechnungseinheit für LLM-Inferenz — etwa 4 Zeichen oder 0,75 Wörter. Ein Prompt mit 1.000 Wörtern ≈ 1.333 Input-Token.
- RAG (Retrieval-Augmented Generation)
- Muster, das relevante Dokumentfragmente aus dem Knowledge Graph abruft und sie als Kontext an das LLM übergibt — verankert Antworten in Unternehmensdaten, erhöht die Input-Token-Kosten.
- Semantisches Caching
- Technik, die LLM-Antworten nach Embedding-Ähnlichkeit indiziert speichert — bei einer kosinus-ähnlichen Folgeanfrage wird die zwischengespeicherte Antwort ohne Live-LLM-Aufruf zurückgegeben.
- Cross-Encoder Re-Ranker
- Leichtgewichtiges Modell, das die Relevanz abgerufener RAG-Fragmente bewertet, bevor sie an das Haupt-LLM übergeben werden — reduziert die Input-Token-Zahl um 50–70 % bei minimalem Qualitätsverlust.
- resource-group
- Optionaler Header der AI-Core-API, der den Token-Verbrauch einer benannten logischen Gruppe zuordnet (z. B. „finance", „hr") — ermöglicht dem BTP-Kostenmanagement, KI-Ausgaben nach Geschäftsbereich aufzuschlüsseln.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Quellen
- SAP AI Core — Help Portal (Model Gateway, pricing, resource groups)
- SAP BTP Cost Management documentation
- SAP TechEd 2025 — AI Core Model Gateway architecture session
- SAP Community — Generative AI Hub and AI Core best practices
- OpenAI — Tokenization reference (tiktoken, token counting)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- EU AI Act — Regulation (EU) 2024/1689, Art. 14 (Human Oversight)
- CJEU Case C-311/18 — Schrems-II ruling (EUR-Lex)
- SAP Help Portal — SAP AI Core documentation
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.