AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Observabilité IA dans SAP AI Core — consommation de tokens, hallucination, dérive

Observabilité IA dans SAP AI Core — consommation de tokens, hallucination, dérive — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Observabilité IA dans SAP AI Core ?

Dans SAP AI Core, l'observabilité se construit à partir de briques documentées, pas d'un « Model Gateway » : la consommation de tokens renvoyée à chaque réponse d'orchestration, l'inference observability (disponible depuis le 8 mai 2026) pour enregistrer les requêtes signalées avec labels et retours, et les métriques d'ancrage LLM-as-a-judge du service d'évaluation pour détecter hors ligne hallucinations et dérive.

Ce que recouvre l'observabilité IA

L'observabilité IA consiste à mesurer en continu le comportement d'un système d'IA générative en production — pas en démonstration, mais sur le trafic réel. Trois questions comptent : combien de tokens consomme chaque appel (le coût), les réponses sont-elles étayées par les données fournies au modèle (l'hallucination), et la qualité dérive-t-elle au fil du temps quand les prompts, les sources de grounding ou les versions de modèle changent (la dérive). Ce qui en fait une exigence de gouvernance, c'est le silence de la panne : un rapport cassé renvoie une erreur, un assistant qui hallucine renvoie une réponse fausse, bien formée et assurée.

Les versions précédentes de cette fiche attribuaient la mesure des tokens à un « AI Core Model Gateway ». SAP ne livre aucun composant de ce nom. Dans SAP AI Core, les instruments sont le service d'orchestration et l'API harmonisée du generative AI hub (qui renvoient la consommation de tokens à chaque réponse), l'inference observability (disponibilité générale le 8 mai 2026), le service d'évaluation et ses métriques prédéfinies, et les outils d'usage et de budget de BTP. Les appels de modèles de Joule lui-même sont gérés par SAP et ne sont pas observables dans votre tenant ; ce qui suit s'applique à ce que vous construisez sur le generative AI hub.

Pourquoi c'est important

  • Un assistant qui hallucine échoue en silence : sans inférences enregistrées ni notation de l'ancrage, une erreur systémique est découverte par les utilisateurs qui agissent dessus, pas par l'équipe.
  • Rien n'est enregistré par défaut dans SAP AI Core — ni le journal d'audit ni l'inference observability ne captent les prompts si les en-têtes de la requête ne le demandent pas.
  • Les obligations de journalisation de l'AI Act pour les systèmes à haut risque (art. 12, art. 26, par. 6) s'appliquent à partir du 2 décembre 2027 pour l'annexe III ; la piste de preuve se conçoit, elle ne se rajoute pas après coup.

Points clés

  • Pas de « Model Gateway » : les décomptes de tokens viennent de l'objet usage (prompt_tokens, completion_tokens, total_tokens) de chaque réponse d'orchestration et d'API harmonisée.
  • L'inference observability (disponible depuis le 8 mai 2026, Cloud Foundry, hors cloud souverain) n'enregistre que les requêtes signalées par ai-inference-observability-persistence-mode = metadata ou full.
  • Mode metadata : nom et version du modèle, tokens d'entrée/sortie, latence, jusqu'à 16 labels ext.ai.sap.com — sans magasin d'objets. Le mode full ajoute requête, réponse et retours dans un magasin S3.
  • Les charges utiles sont stockées sans masquage ni assainissement : consentement pour les données personnelles et lecture protégée contre l'injection incombent au client ; supprimer les métadonnées ne purge pas S3.
  • Hallucination : service d'évaluation (genai-evaluation) avec Pointwise RAG Groundedness (1–3), Context Relevance (1–3) et Correctness (1–5) comme métriques LLM-as-a-judge.
  • SAP a jugé les métriques calculées (BERTScore, BLEU, similarité cosinus) faibles pour évaluer l'ancrage face au LLM-as-a-judge — les seuils se calibrent sur vos propres données.
  • Dérive : figer model.version, suivre les obsolescences dans la note SAP 3437766, surveiller intermediate_failures des replis, rejouer un jeu de référence à chaque changement.
  • Le journal d'audit d'AI Core contient des événements de gestion, pas des prompts ; la preuve réglementaire exige l'enregistrement en mode full ou vos propres journaux.

Termes employés sur cette page

Inference observability
Capacité du generative AI hub (disponible depuis le 8 mai 2026) qui enregistre les inférences signalées vers l'orchestration ou les modèles de fondation, en métadonnées ou en charge utile complète, avec labels et retours.
Mode de persistance
Valeur de l'en-tête ai-inference-observability-persistence-mode : metadata (modèle, tokens, latence) ou full (plus requête, réponse et retours dans S3).
Enregistrement d'inférence
Résultat stocké d'une inférence enregistrée, retrouvable par identifiant ou sélecteur de label ; supprimer ses données efface métadonnées et labels, pas les charges utiles S3.
Métrique LLM-as-a-judge
Métrique d'évaluation notée par un modèle de langage, comme Pointwise RAG Groundedness, Context Relevance ou Correctness dans le service d'évaluation.
Ancrage (groundedness)
Mesure dans laquelle une réponse est étayée par le contexte fourni au modèle ; principal signal d'hallucination en RAG.
Dérive
Évolution de la qualité des réponses dans le temps due aux changements de prompts, de sources de grounding ou de modèles, détectée en rejouant un jeu d'évaluation fixe.
intermediate_failures
Champ de la réponse d'orchestration qui indique pourquoi les configurations préférées ont été écartées — la trace d'un repli.

Sources

  1. SAP AI Core — Inference Observability (SAP-docs)
  2. SAP AI Core — Record an Inference in Inference Observability (SAP-docs)
  3. SAP AI Core — Retrieving an Inference Record (SAP-docs)
  4. SAP AI Core — Deleting Inference Record Data (SAP-docs)
  5. SAP AI Core — System-Defined Evaluation Metrics (SAP-docs)
  6. SAP AI Core — Computed Metrics vs LLM-as-a-Judge Metrics (SAP-docs)
  7. SAP AI Core — Orchestration Workflow V2 (usage object, SAP-docs)
  8. SAP AI Core — What's New (inference observability GA, SAP-docs)
  9. SAP AI Core service guide — metering incl. inference observability (PDF, 4 Sep 2026)
  10. EU AI Act — Regulation (EU) 2024/1689 (EUR-Lex)
  11. OWASP — Top 10 for LLM Applications 2025 (LLM10 Unbounded Consumption, LLM09 Misinformation)
  12. NIST — AI Risk Management Framework 1.0 (Govern, Map, Measure, Manage; 26 Jan 2023)
  13. OpenTelemetry — Semantic conventions for generative AI (spans, metrics, events)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →