Analytics Legends Die Wissensplattform für SAP Analytics
Academy-Modul

LLM-Kostenengineering — AI Units, Token-Budgets, Caching

LLM-Kostenengineering — AI Units, Token-Budgets, Caching — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-09-25

SAP bepreist generative KI über zwei Währungen, die niemals vermischt werden dürfen: Capacity Units, aus Tokens über ein modellspezifisches, in SAP-Hinweis 3437766 veröffentlichtes GenAI-Token-Verhältnis umgerechnet, und AI Units, SAPs einzige virtuelle Währung für Premium AI — autonome Agenten zu 0,02 AI Units pro Aktion, SAP Joule for Consultants zu 35 AI Units und bis zu 22.900 gepoolten Anfragen pro Nutzer und Monat. Dieses Modul folgt SAPs eigener Dokumentation zu Rate Limits und Prompt Caching in AI Core, um die Gegenmaßnahmen-Sequenz für einen 429-Rate-Limit-Fehler, die explizite cache_control-Platzierung und ihre Unterschiede zwischen Claude und Nova sowie die Usage-Felder (cached_tokens, cache_creation_tokens) zu behandeln, die beweisen, dass eine Caching-Strategie tatsächlich funktioniert hat, und die Governance-Disziplin eines Token-Budgets pro Funktion, gesetzt aus gemessener Nutzung mit einem aussagekräftigen Alarmschwellenwert. Es schließt mit einer Fünf-Schritte-Sequenz zum Aufbau eines datierten, belegten Kostenfalls statt einer ängstlichen Vermutung. Drei Übungen und eine Selbsttest bedingen den Übergang zu M366.

Was Sie lernen

  • SAPs zwei Kostenwährungen unterscheiden — Capacity Units für den Generative AI Hub und AI Units für Premium Business AI — und eine Workload korrekt zuordnen, ohne sie zu vermischen
  • SAPs eigene veröffentlichte AI-Units-Zahlen (0,02 AI Units pro Agentenaktion; 35 AI Units und bis zu 22.900 gepoolte Anfragen pro Nutzer und Monat für Joule for Consultants) exakt und datiert zitieren
  • Erklären, wie Rate Limits des Generative AI Hub funktionieren (RPM, Resource-Group- vs. Tenant-Geltungsbereich, der Quota-Erhöhungsprozess) und die richtige Gegenmaßnahmen-Sequenz bei Überschreitung anwenden
  • Eine explizite Prompt-Caching-Strategie entwerfen — korrekte cache_control-Platzierung, TTL-Wahl, Unterschiede zwischen den Modellfamilien Claude und Nova — und ihre Ersparnis aus cached_tokens und cache_creation_tokens verifizieren
  • Ein Token-Budget pro Funktion setzen und steuern, basierend auf gemessener Nutzung mit einem Alarmschwellenwert, nicht einer tenant-weiten Vermutung
  • Einen datierten, belegten Kostenfall für eine Kundenmission aufbauen, der Capacity Units und AI Units niemals vermischt

Für wen dieses Modul gedacht ist. M333 hat SAPs Mess-Kette eingeführt — Tokens zu GenAI-Tokens zu Capacity Units — und davor gewarnt, SAPs fiktives Rechenbeispiel als Preis zu zitieren. Dieses Modul geht weiter: Es trennt SAPs zwei tatsächlich verschiedene Kostenwährungen (Capacity Units für den Generative AI Hub, AI Units für Premium Business AI) und gibt Ihnen die drei Hebel, die eine Kostenzeile tatsächlich bewegen — Rate Limits, Prompt Caching, und schlicht zu wissen, in welcher Währung Sie überhaupt ausgeben.

1. Zwei Währungen, nicht eine — und sie zu vermischen ist der häufigste Schätzfehler

SAP bepreist generative KI über zwei getrennte kommerzielle Modelle, und eine Kostenschätzung, die beide vermischt, ist konstruktionsbedingt falsch, nicht nur um eine kleine Marge. Capacity Units (CUs) sind die allgemeine Abrechnungsmetrik von SAP BTP; der Verbrauch des Generative AI Hub rechnet sich über die in M333 eingeführte Kette in sie um — pro Anfrage gezählte Tokens, umgerechnet in GenAI-Tokens zu einem modellspezifischen Verhältnis, veröffentlicht in SAP-Hinweis 3437766, dann GenAI-Tokens umgerechnet in CUs über einen modellspezifischen Faktor. Das ist die Währung roher Modellaufrufe über die Orchestration: Ihre eigenen Prompts, Ihre eigene Retrieval, Ihre eigene Agentenschleife, abgerechnet nach dem, was Sie tatsächlich senden und empfangen.

Voraussetzungen

  • M333 (KI- und LLM-Grundlagen) — dieses Modul baut direkt auf dessen Kette Tokens-zu-GenAI-Tokens-zu-Capacity-Units und auf SAP-Hinweis 3437766 auf
  • Grundlegende Vertrautheit mit der Request-Struktur des Orchestration Service (module_configurations, prompt_templating)
  • Optional: Zugang zum Generative AI Hub, um E1-E2 an echten Nutzungsdaten statt auf Papier durchzuführen

Lernergebnisse

  • Jede Workload generativer KI korrekt Capacity Units oder AI Units zuordnen, bevor ihre Kosten geschätzt werden
  • Einen rate-limit-bewussten Deployment-Plan erstellen, der die Gegenmaßnahmen-Sequenz und den Quota-Erhöhungs-Vorlauf benennt
  • Eine Prompt-Caching-Konfiguration entwerfen und verifizieren, die die Kosten messbar senkt, nicht nur eine Konfiguration, die richtig aussieht
  • Ein Token-Budget pro Funktion mit einer gemessenen Basislinie und einem aussagekräftigen Alarmschwellenwert setzen

Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.

In der App öffnen →