Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation

Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation?

Bei 200.000 täglichen Joule-Sitzungen spart allein eine Token-Reduktion um 10 % zwischen 36.000 und 252.000 US-Dollar pro Jahr — deshalb ist Prompt Engineering abrechenbare Beratungsleistung und kein Nice-to-have.

Worum es geht

Inferenz-Ökonomie ist die Disziplin, LLMs mit den Kosten, der Latenz und dem Durchsatz zu betreiben, die Enterprise-Workloads dauerhaft tragen können. Für SAP-Praktiker bedeutet das: die Pro-1K-Token-Rechnung für das BTP-gehostete Joule zu verstehen, zu wissen, welche Optimierungshebel innerhalb der SAP-Vertrauensgrenze verfügbar sind, und einen Business Case für AI-Ausgaben aufzustellen, den CFOs genehmigen.

Die Kosten der Inferenz setzen sich aus drei Komponenten zusammen: Compute (GPU-Zeit pro Forward Pass), Speicherbandbreite (KV-Cache-Lese-/Schreibzugriffe) und I/O (Netzwerk + Storage). Bei gemanagten API-Preismodellen (OpenAI, Anthropic, SAP BTP Generative AI Hub) werden diese zu einem Preis pro Token gebündelt: Input-Token werden zu einem Satz abgerechnet, Output-Token zu einem höheren Satz (die Output-Generierung ist autoregressiv und damit rechenintensiv). Im SAP BTP Generative AI Hub folgt die Preisgestaltung von GPT-4o Stand 2026 dem kommerziellen OpenAI-Preisplan, durchgereicht mit der SAP-Reseller-Marge — etwa 0,005-0,015 US-Dollar pro 1K Input-Token und 0,015-0,060 US-Dollar pro 1K Output-Token, je nach Modell und Tier. Ein Joule-Helpdesk-Assistent für S/4HANA mit 200.000 täglichen Sitzungen, 1K Input- + 500 Output-Token pro Sitzung = 200 Mio. Input- + 100 Mio. Output-Token pro Tag = etwa 1.000-7.000 US-Dollar pro Tag zum Listenpreis. Bei dieser Größenordnung spart jede 10-prozentige Token-Reduktion 36.000-252.000 US-Dollar pro Jahr — deshalb ist Prompt Engineering eine abrechenbare Beratungsleistung.

Warum es zählt

  • Output-Token kosten das 3-4-Fache von Input-Token, weil die Generierung autoregressiv erfolgt — daher spart eine Kürzung der Output-Länge mehr als eine Kürzung des Inputs.
  • Die TTFT skaliert mit der Input-Länge — ein 10K-Token-Prompt braucht bis zum ersten Token etwa 10× so lange wie ein 1K-Token-Prompt, was interaktive Joule-Assistenten mit einer Zielzeit unter 2 Sekunden unmöglich macht, sofern der Input nicht begrenzt und gestreamt wird.
  • INT8-Quantisierung halbiert Compute und Speicher bei unter 1 % Qualitätsverlust, während INT4 das 4-Fache spart, aber 3-8 % Qualität kostet — geeignet für Zusammenfassungen, nicht für finanzielle Entscheidungsunterstützung.

Kernpunkte

  • Inferenzkosten = Input-Token × Input-Satz + Output-Token × Output-Satz; der BTP Generative AI Hub reicht die OpenAI-Listenpreise mit SAP-Reseller-Marge durch (~0,005-0,060 US-Dollar/1K Token, je nach Modell).
  • Die Time-to-First-Token (TTFT) skaliert mit der Input-Länge; die Inter-Token-Latenz (ITL) ist pro Schritt annähernd konstant — interaktive Joule-Workflows müssen die Input-Länge begrenzen und Streaming aktivieren.
  • INT8-Quantisierung: ~2-fache Reduktion von Speicher/Compute, < 1 % Qualitätsverlust — produktionstauglich für die meisten SAP-Aufgaben. INT4: ~4-fache Reduktion, 3-8 % Qualitätsverlust — nur für risikoarme Zusammenfassungen akzeptabel.
  • Distillation trainiert ein kleines Student-Modell (7B) darauf, einen großen Teacher (GPT-4-Klasse) bei einer bestimmten Aufgabe nachzuahmen — 10-100-fache Reduktion der Inferenzkosten bei Erhalt von 70-90 % der aufgabenspezifischen Genauigkeit.
  • Bei 200.000 täglichen SAP-Joule-Sitzungen (1K Input- + 500 Output-Token) liegen die Kosten zum Listenpreis bei 1.000-7.000 US-Dollar pro Tag; eine 10-prozentige Token-Reduktion bedeutet eine Ersparnis von 36.000-252.000 US-Dollar pro Jahr.
  • Trade-off Batch vs. interaktiv: Bei nächtlichen SAP-Analytics-Batch-Jobs den Durchsatz maximieren (große Batch-Größe, INT8); bei interaktiven Joule-Assistenten die TTFT minimieren (kurze Inputs, Streaming, Prefix-Caching).
  • Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation ist erst beherrscht, wenn sie die Entscheidung eines konkret benannten Buyers verändert.
  • Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
  • Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
  • Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.

Begriffe auf dieser Seite

TTFT (Time-to-first-token)
Latenz von der Anfrageübermittlung bis zur Ausgabe des ersten Output-Tokens; dominiert durch den Prefill-Durchlauf über den gesamten Input-Kontext.
Quantisierung
Reduzierung der numerischen Präzision von Modellgewichten (z. B. FP16 → INT8 → INT4), um den Speicherbedarf und den Inferenz-Compute zu senken, bei kontrolliertem Qualitäts-Trade-off.
Distillation
Training eines kleineren Student-Modells, um die Output-Verteilung eines größeren Teacher-Modells bei einer Zielaufgabe nachzuahmen; erzeugt ein aufgabenspezifisches Modell, das bei der Inferenz 10-100× günstiger ist.
Durchsatz
Anzahl der pro Sekunde generierten Token über alle gleichzeitigen Anfragen hinweg; wird durch große Batch-Größen und Quantisierung maximiert; die relevante Kennzahl für Batch-Analytics-Workloads.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.

Quellen

  1. SAP BTP Generative AI Hub — pricing and service plans
  2. Dettmers et al. — LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale (2022)
  3. Hinton et al. — Distilling the Knowledge in a Neural Network (2015)
  4. Kwon et al. — Efficient Memory Management for LLM Serving with PagedAttention (2023)
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site
  24. SAP Help Portal — Joule
  25. NIST — AI Risk Management Framework
  26. Google Cloud — 101 real-world generative AI use cases

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →