Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation
Stand 2026-07-23
Was ist Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation?
Bei 200.000 täglichen Joule-Sitzungen spart allein eine Token-Reduktion um 10 % zwischen 36.000 und 252.000 US-Dollar pro Jahr — deshalb ist Prompt Engineering abrechenbare Beratungsleistung und kein Nice-to-have.
Worum es geht
Inferenz-Ökonomie ist die Disziplin, LLMs mit den Kosten, der Latenz und dem Durchsatz zu betreiben, die Enterprise-Workloads dauerhaft tragen können. Für SAP-Praktiker bedeutet das: die Pro-1K-Token-Rechnung für das BTP-gehostete Joule zu verstehen, zu wissen, welche Optimierungshebel innerhalb der SAP-Vertrauensgrenze verfügbar sind, und einen Business Case für AI-Ausgaben aufzustellen, den CFOs genehmigen.
Die Kosten der Inferenz setzen sich aus drei Komponenten zusammen: Compute (GPU-Zeit pro Forward Pass), Speicherbandbreite (KV-Cache-Lese-/Schreibzugriffe) und I/O (Netzwerk + Storage). Bei gemanagten API-Preismodellen (OpenAI, Anthropic, SAP BTP Generative AI Hub) werden diese zu einem Preis pro Token gebündelt: Input-Token werden zu einem Satz abgerechnet, Output-Token zu einem höheren Satz (die Output-Generierung ist autoregressiv und damit rechenintensiv). Im SAP BTP Generative AI Hub folgt die Preisgestaltung von GPT-4o Stand 2026 dem kommerziellen OpenAI-Preisplan, durchgereicht mit der SAP-Reseller-Marge — etwa 0,005-0,015 US-Dollar pro 1K Input-Token und 0,015-0,060 US-Dollar pro 1K Output-Token, je nach Modell und Tier. Ein Joule-Helpdesk-Assistent für S/4HANA mit 200.000 täglichen Sitzungen, 1K Input- + 500 Output-Token pro Sitzung = 200 Mio. Input- + 100 Mio. Output-Token pro Tag = etwa 1.000-7.000 US-Dollar pro Tag zum Listenpreis. Bei dieser Größenordnung spart jede 10-prozentige Token-Reduktion 36.000-252.000 US-Dollar pro Jahr — deshalb ist Prompt Engineering eine abrechenbare Beratungsleistung.
Warum es zählt
- Output-Token kosten das 3-4-Fache von Input-Token, weil die Generierung autoregressiv erfolgt — daher spart eine Kürzung der Output-Länge mehr als eine Kürzung des Inputs.
- Die TTFT skaliert mit der Input-Länge — ein 10K-Token-Prompt braucht bis zum ersten Token etwa 10× so lange wie ein 1K-Token-Prompt, was interaktive Joule-Assistenten mit einer Zielzeit unter 2 Sekunden unmöglich macht, sofern der Input nicht begrenzt und gestreamt wird.
- INT8-Quantisierung halbiert Compute und Speicher bei unter 1 % Qualitätsverlust, während INT4 das 4-Fache spart, aber 3-8 % Qualität kostet — geeignet für Zusammenfassungen, nicht für finanzielle Entscheidungsunterstützung.
Kernpunkte
- Inferenzkosten = Input-Token × Input-Satz + Output-Token × Output-Satz; der BTP Generative AI Hub reicht die OpenAI-Listenpreise mit SAP-Reseller-Marge durch (~0,005-0,060 US-Dollar/1K Token, je nach Modell).
- Die Time-to-First-Token (TTFT) skaliert mit der Input-Länge; die Inter-Token-Latenz (ITL) ist pro Schritt annähernd konstant — interaktive Joule-Workflows müssen die Input-Länge begrenzen und Streaming aktivieren.
- INT8-Quantisierung: ~2-fache Reduktion von Speicher/Compute, < 1 % Qualitätsverlust — produktionstauglich für die meisten SAP-Aufgaben. INT4: ~4-fache Reduktion, 3-8 % Qualitätsverlust — nur für risikoarme Zusammenfassungen akzeptabel.
- Distillation trainiert ein kleines Student-Modell (7B) darauf, einen großen Teacher (GPT-4-Klasse) bei einer bestimmten Aufgabe nachzuahmen — 10-100-fache Reduktion der Inferenzkosten bei Erhalt von 70-90 % der aufgabenspezifischen Genauigkeit.
- Bei 200.000 täglichen SAP-Joule-Sitzungen (1K Input- + 500 Output-Token) liegen die Kosten zum Listenpreis bei 1.000-7.000 US-Dollar pro Tag; eine 10-prozentige Token-Reduktion bedeutet eine Ersparnis von 36.000-252.000 US-Dollar pro Jahr.
- Trade-off Batch vs. interaktiv: Bei nächtlichen SAP-Analytics-Batch-Jobs den Durchsatz maximieren (große Batch-Größe, INT8); bei interaktiven Joule-Assistenten die TTFT minimieren (kurze Inputs, Streaming, Prefix-Caching).
- Inferenz-Ökonomie — Kosten, Latenz, Quantisierung, Distillation ist erst beherrscht, wenn sie die Entscheidung eines konkret benannten Buyers verändert.
- Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
- Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
- Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.
Begriffe auf dieser Seite
- TTFT (Time-to-first-token)
- Latenz von der Anfrageübermittlung bis zur Ausgabe des ersten Output-Tokens; dominiert durch den Prefill-Durchlauf über den gesamten Input-Kontext.
- Quantisierung
- Reduzierung der numerischen Präzision von Modellgewichten (z. B. FP16 → INT8 → INT4), um den Speicherbedarf und den Inferenz-Compute zu senken, bei kontrolliertem Qualitäts-Trade-off.
- Distillation
- Training eines kleineren Student-Modells, um die Output-Verteilung eines größeren Teacher-Modells bei einer Zielaufgabe nachzuahmen; erzeugt ein aufgabenspezifisches Modell, das bei der Inferenz 10-100× günstiger ist.
- Durchsatz
- Anzahl der pro Sekunde generierten Token über alle gleichzeitigen Anfragen hinweg; wird durch große Batch-Größen und Quantisierung maximiert; die relevante Kennzahl für Batch-Analytics-Workloads.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.
Quellen
- SAP BTP Generative AI Hub — pricing and service plans
- Dettmers et al. — LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale (2022)
- Hinton et al. — Distilling the Knowledge in a Neural Network (2015)
- Kwon et al. — Efficient Memory Management for LLM Serving with PagedAttention (2023)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- SAP Help Portal — Joule
- NIST — AI Risk Management Framework
- Google Cloud — 101 real-world generative AI use cases
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.