Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

KI-Observability — Token-Verbrauch, Halluzination, Drift

KI-Observability — Token-Verbrauch, Halluzination, Drift — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist KI-Observability — Token-Verbrauch, Halluzination, Drift?

Die Halluzinationserkennung im Produktivbetrieb läuft über ein schnelles Sekundärmodell (Cross-Encoder oder Entailment-Klassifikator, unter 100 ms, unter 10 % der Token-Kosten des Hauptmodells), das jede Antwort gegen ihre Grounding-Textabschnitte bewertet.

Worum es geht

KI-Observability ist die Praxis, kontinuierlich zu messen, wie sich ein generatives KI-System im Live-Betrieb verhält – nicht vorher, in einer Demo, sondern in der unordentlichen Realität des Produktivverkehrs. Im SAP-Kontext bedeutet das, drei Dinge ständig zu beobachten: wie viele Tokens jeder Joule- oder AI-Core-Model-Gateway-Aufruf verbraucht, ob die Antworten eines Modells angesichts der ihm gezeigten Daten tatsächlich zutreffen, und ob sich die Antwortqualität im Laufe der Zeit still verändert, während Prompts angepasst, Grounding-Quellen aktualisiert oder das zugrunde liegende Modell hinter der API erneuert werden. Ohne diese Disziplin kann ein Projekt, das in einem Proof of Concept gut abgeschnitten hat, sich über Monate hinweg verschlechtern, bevor es jemand bemerkt – weil niemand das System so beobachtet, wie man eine Datenbank oder eine Benutzeroberfläche beobachtet.

Warum es wichtig ist: Enterprise-KI unterscheidet sich in einem entscheidenden Punkt von traditioneller Software – ihre Fehlermodi sind stumm. Ein defekter SQL-Bericht wirft einen Fehler. Ein halluzinierender KI-Assistent liefert stattdessen eine selbstbewusste, gut formatierte, falsche Antwort, und der Nutzer hat keine Möglichkeit, sie von einer korrekten zu unterscheiden, es sei denn, er kennt die Antwort bereits. Diese Asymmetrie macht Observability zu einer Governance-Pflicht, nicht zu einem netten Extra. Für einen in SAP-Daten verankerten Finanz- oder Supply-Chain-Anwendungsfall kann eine einzige unbemerkte Halluzination, auf die gehandelt wird, mehr kosten als ein Jahr Monitoring-Tooling.

Warum es zählt

  • Ein Budgetalarm, der auslöst, wenn der gleitende 7-Tage-Token-Verbrauch 110 % des 30-Tage-Durchschnitts übersteigt, erfasst Kostenüberschreitungen vor der Monatsrechnung
  • Der Grounding-Verifikations-Klassifikator läuft in unter 100 ms und unter 10 % der Kosten des Hauptmodells, was die Prüfung jeder einzelnen Antwort wirtschaftlich tragfähig macht
  • Die Schwellenwerte 0,70/0,85 verwandeln 'mögliche Halluzination' in eine automatische Ablehnungs-/Prüfungs-/Freigabe-Entscheidung statt in eine Ermessensfrage

Kernpunkte

  • Drei Observability-Ebenen: Token-Verbrauch (Kosten), Halluzinationserkennung (Grounding-Genauigkeit), semantische Drift (Antwortstabilität über die Zeit).
  • Grounding-Score-Schwellenwert: ablehnen < 0,70, markieren 0,70–0,85, bestehen > 0,85 – am eigenen Domänenkorpus kalibrieren, nicht an generischen Standardwerten.
  • Die Konformität mit Artikel 9 des EU AI Act erfordert strukturierte Produktivprotokolle von Modelleingaben, -ausgaben, Grounding-Quellen und Scores – Frist 2026-08-02 für eingesetzte Hochrisikosysteme.
  • Drift-Regressionssuite: 50–200 goldene Frage-Antwort-Paare, wöchentlich ausgeführt, Kosinus-Ähnlichkeitsalarm bei Δ > 0,10 gegenüber der Baseline.
  • Observability-Sidecar-Muster: leichtgewichtige Python-App fängt die AI-Core-Antwort ab, bewertet das Grounding, protokolliert in einer HANA-Cloud-Zeitreihe, fügt < 50 ms Latenz hinzu.
  • Budgetalarm: gleitender 7-Tage-Tagesverbrauch an Tokens > 110 % des 30-Tage-Durchschnitts löst vor der Überraschung der Monatsendrechnung aus.
  • Zitation ohne Verifikation ist Theater – Modelle halluzinieren Zitate fast so bereitwillig wie Fakten.
  • KI-Observability — Token-Verbrauch, Halluzination, Drift ist erst dann beherrscht, wenn es eine konkret benannte Entscheidung des Auftraggebers verändert.
  • Zuerst das semantische Vertrags- und Kontrollmodell klären, bevor das Tool demonstriert wird.
  • Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.

Begriffe auf dieser Seite

Grounding score
0–1-Wert eines Cross-Encoders oder Entailment-Klassifikators, der misst, ob jede sachliche Behauptung in einer Modellantwort durch die abgerufenen Knowledge-Graph-Textabschnitte gestützt wird – das primäre Halluzinationssignal.
Golden dataset
Kuratierte Menge von 50–200 kanonischen Frage-Antwort-Paaren, die zur wöchentlichen Erkennung semantischer Drift per Regression dient; Ground Truth für die eigene Domäne und das eigene Geschäftsvokabular.
Semantische Drift
Allmähliche Verschiebung der Antwortqualität, des Tonfalls oder der Genauigkeit eines Modells über die Zeit – verursacht durch Prompt-Änderungen, Änderungen der Grounding-Daten oder stille Modellaktualisierungen – nur durch Regressionstests erkennbar.
Prompt drift
Teilmenge der semantischen Drift, verursacht durch schrittweise Prompt-Engineering-Änderungen, die sich über Monate ohne formale Regressionsschranke ansammeln.
Observability-Sidecar
Leichtgewichtiger Proxy-Dienst, der AI-Core-Gateway-Antworten abfängt, das Grounding bewertet und strukturierte Observability-Datensätze in einem Zeitreihenspeicher protokolliert – fügt < 50 ms Latenz hinzu.
Entailment classifier
NLI-Modell (Natural Language Inference), das kennzeichnet, ob eine Hypothese (Modellbehauptung) durch eine Prämisse (Quelltextabschnitt) gestützt, ihr gegenüber neutral oder von ihr widerlegt wird.
Decision owner
Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
Semantic contract
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.

Quellen

  1. EU AI Act — Regulation (EU) 2024/1689 Article 9 (risk management systems)
  2. SAP AI Core — Help Portal (execution logs, model performance)
  3. Ragas — RAG evaluation framework (faithfulness, answer relevance metrics)
  4. SAP TechEd 2025 — AI observability and responsible AI session
  5. SAP Community — AI Core monitoring and operations best practices
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP — industries overview
  17. Gartner — research & analyst site
  18. BARC — BI & Analytics research
  19. TDWI — data & analytics research
  20. DSAG — German-speaking SAP user group
  21. ASUG — Americas' SAP User Group
  22. Databricks — official site
  23. SAP Help — Generative AI Hub overview
  24. NIST — AI Risk Management Framework knowledge base
  25. OpenTelemetry — Observability primer

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →