KI-Observability — Token-Verbrauch, Halluzination, Drift
Stand 2026-07-24T14:00:00Z
Was ist KI-Observability — Token-Verbrauch, Halluzination, Drift?
Die Halluzinationserkennung im Produktivbetrieb läuft über ein schnelles Sekundärmodell (Cross-Encoder oder Entailment-Klassifikator, unter 100 ms, unter 10 % der Token-Kosten des Hauptmodells), das jede Antwort gegen ihre Grounding-Textabschnitte bewertet.
Worum es geht
KI-Observability ist die Praxis, kontinuierlich zu messen, wie sich ein generatives KI-System im Live-Betrieb verhält – nicht vorher, in einer Demo, sondern in der unordentlichen Realität des Produktivverkehrs. Im SAP-Kontext bedeutet das, drei Dinge ständig zu beobachten: wie viele Tokens jeder Joule- oder AI-Core-Model-Gateway-Aufruf verbraucht, ob die Antworten eines Modells angesichts der ihm gezeigten Daten tatsächlich zutreffen, und ob sich die Antwortqualität im Laufe der Zeit still verändert, während Prompts angepasst, Grounding-Quellen aktualisiert oder das zugrunde liegende Modell hinter der API erneuert werden. Ohne diese Disziplin kann ein Projekt, das in einem Proof of Concept gut abgeschnitten hat, sich über Monate hinweg verschlechtern, bevor es jemand bemerkt – weil niemand das System so beobachtet, wie man eine Datenbank oder eine Benutzeroberfläche beobachtet.
Warum es wichtig ist: Enterprise-KI unterscheidet sich in einem entscheidenden Punkt von traditioneller Software – ihre Fehlermodi sind stumm. Ein defekter SQL-Bericht wirft einen Fehler. Ein halluzinierender KI-Assistent liefert stattdessen eine selbstbewusste, gut formatierte, falsche Antwort, und der Nutzer hat keine Möglichkeit, sie von einer korrekten zu unterscheiden, es sei denn, er kennt die Antwort bereits. Diese Asymmetrie macht Observability zu einer Governance-Pflicht, nicht zu einem netten Extra. Für einen in SAP-Daten verankerten Finanz- oder Supply-Chain-Anwendungsfall kann eine einzige unbemerkte Halluzination, auf die gehandelt wird, mehr kosten als ein Jahr Monitoring-Tooling.
Warum es zählt
- Ein Budgetalarm, der auslöst, wenn der gleitende 7-Tage-Token-Verbrauch 110 % des 30-Tage-Durchschnitts übersteigt, erfasst Kostenüberschreitungen vor der Monatsrechnung
- Der Grounding-Verifikations-Klassifikator läuft in unter 100 ms und unter 10 % der Kosten des Hauptmodells, was die Prüfung jeder einzelnen Antwort wirtschaftlich tragfähig macht
- Die Schwellenwerte 0,70/0,85 verwandeln 'mögliche Halluzination' in eine automatische Ablehnungs-/Prüfungs-/Freigabe-Entscheidung statt in eine Ermessensfrage
Kernpunkte
- Drei Observability-Ebenen: Token-Verbrauch (Kosten), Halluzinationserkennung (Grounding-Genauigkeit), semantische Drift (Antwortstabilität über die Zeit).
- Grounding-Score-Schwellenwert: ablehnen < 0,70, markieren 0,70–0,85, bestehen > 0,85 – am eigenen Domänenkorpus kalibrieren, nicht an generischen Standardwerten.
- Die Konformität mit Artikel 9 des EU AI Act erfordert strukturierte Produktivprotokolle von Modelleingaben, -ausgaben, Grounding-Quellen und Scores – Frist 2026-08-02 für eingesetzte Hochrisikosysteme.
- Drift-Regressionssuite: 50–200 goldene Frage-Antwort-Paare, wöchentlich ausgeführt, Kosinus-Ähnlichkeitsalarm bei Δ > 0,10 gegenüber der Baseline.
- Observability-Sidecar-Muster: leichtgewichtige Python-App fängt die AI-Core-Antwort ab, bewertet das Grounding, protokolliert in einer HANA-Cloud-Zeitreihe, fügt < 50 ms Latenz hinzu.
- Budgetalarm: gleitender 7-Tage-Tagesverbrauch an Tokens > 110 % des 30-Tage-Durchschnitts löst vor der Überraschung der Monatsendrechnung aus.
- Zitation ohne Verifikation ist Theater – Modelle halluzinieren Zitate fast so bereitwillig wie Fakten.
- KI-Observability — Token-Verbrauch, Halluzination, Drift ist erst dann beherrscht, wenn es eine konkret benannte Entscheidung des Auftraggebers verändert.
- Zuerst das semantische Vertrags- und Kontrollmodell klären, bevor das Tool demonstriert wird.
- Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
Begriffe auf dieser Seite
- Grounding score
- 0–1-Wert eines Cross-Encoders oder Entailment-Klassifikators, der misst, ob jede sachliche Behauptung in einer Modellantwort durch die abgerufenen Knowledge-Graph-Textabschnitte gestützt wird – das primäre Halluzinationssignal.
- Golden dataset
- Kuratierte Menge von 50–200 kanonischen Frage-Antwort-Paaren, die zur wöchentlichen Erkennung semantischer Drift per Regression dient; Ground Truth für die eigene Domäne und das eigene Geschäftsvokabular.
- Semantische Drift
- Allmähliche Verschiebung der Antwortqualität, des Tonfalls oder der Genauigkeit eines Modells über die Zeit – verursacht durch Prompt-Änderungen, Änderungen der Grounding-Daten oder stille Modellaktualisierungen – nur durch Regressionstests erkennbar.
- Prompt drift
- Teilmenge der semantischen Drift, verursacht durch schrittweise Prompt-Engineering-Änderungen, die sich über Monate ohne formale Regressionsschranke ansammeln.
- Observability-Sidecar
- Leichtgewichtiger Proxy-Dienst, der AI-Core-Gateway-Antworten abfängt, das Grounding bewertet und strukturierte Observability-Datensätze in einem Zeitreihenspeicher protokolliert – fügt < 50 ms Latenz hinzu.
- Entailment classifier
- NLI-Modell (Natural Language Inference), das kennzeichnet, ob eine Hypothese (Modellbehauptung) durch eine Prämisse (Quelltextabschnitt) gestützt, ihr gegenüber neutral oder von ihr widerlegt wird.
- Decision owner
- Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
- Semantic contract
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Quellen
- EU AI Act — Regulation (EU) 2024/1689 Article 9 (risk management systems)
- SAP AI Core — Help Portal (execution logs, model performance)
- Ragas — RAG evaluation framework (faithfulness, answer relevance metrics)
- SAP TechEd 2025 — AI observability and responsible AI session
- SAP Community — AI Core monitoring and operations best practices
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- SAP Help — Generative AI Hub overview
- NIST — AI Risk Management Framework knowledge base
- OpenTelemetry — Observability primer
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.