Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Observabilité IA — Utilisation des tokens, hallucination, dérive

Observabilité IA — Utilisation des tokens, hallucination, dérive — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Observabilité IA — Utilisation des tokens, hallucination, dérive ?

La détection d'hallucination en production repose sur un modèle secondaire rapide (cross-encoder ou classificateur d'inférence, moins de 100 ms, moins de 10 % du coût en tokens du modèle principal) qui score chaque réponse par rapport à ses chunks d'ancrage.

De quoi il s'agit

L'observabilité de l'IA est la pratique consistant à mesurer en continu le comportement d'un système d'IA générative une fois qu'il est en production — pas avant, en démonstration, mais dans la réalité parfois désordonnée du trafic réel. Dans un contexte SAP, cela signifie surveiller trois choses en permanence : le nombre de tokens consommés par chaque appel Joule ou AI Core Model Gateway, la véracité effective des réponses données par le modèle au regard des données qui lui ont été présentées, et la question de savoir si la qualité des réponses évolue silencieusement dans le temps à mesure que les prompts sont ajustés, que les sources de grounding sont mises à jour, ou que le modèle sous-jacent est rafraîchi en coulisses par le fournisseur. Sans cette discipline, un projet qui obtenait de bons résultats lors d'un proof of concept peut se dégrader pendant des mois sans que personne ne s'en aperçoive — parce que personne ne surveille le système comme on surveille une base de données ou une interface.

Pourquoi c'est important

  • Une alerte budgétaire déclenchée quand la dépense en tokens sur 7 jours glissants dépasse 110 % de la moyenne sur 30 jours détecte les dérapages avant la facture mensuelle
  • Le classificateur de vérification d'ancrage tourne en moins de 100 ms et moins de 10 % du coût du modèle principal, rendant la vérification par réponse économiquement viable
  • Les seuils 0,70/0,85 transforment « hallucination possible » en une décision automatique de rejet/révision/passage plutôt qu'un jugement au cas par cas

Points clés

  • Trois niveaux d'observabilité : utilisation des tokens (coût), détection des hallucinations (précision de l'ancrage), dérive sémantique (stabilité des réponses dans le temps).
  • Seuil de score d'ancrage : rejeter < 0,70, signaler 0,70–0,85, laisser passer > 0,85 — calibrer sur le corpus de votre domaine, pas des valeurs par défaut génériques.
  • La conformité Article 9 de l'EU AI Act nécessite des journaux structurés des entrées, sorties, sources d'ancrage et scores — échéance 2026-08-02 pour les systèmes à haut risque déjà déployés.
  • Suite de régression pour la dérive : 50–200 paires Q&R canoniques, exécutées hebdomadairement, alerte similarité cosine sur Δ > 0,10 par rapport à la baseline.
  • Motif sidecar d'observabilité : app Python légère intercepte la réponse AI Core, score l'ancrage, journalise vers une table de séries temporelles HANA Cloud, ajoute < 50 ms de latence.
  • Alerte budgétaire : dépense quotidienne en tokens sur 7 jours glissants > 110% de la moyenne sur 30 jours déclenche avant la surprise de la facture mensuelle.
  • La citation sans vérification est théâtrale — les modèles hallucinent des citations presque aussi facilement que des faits.

Termes employés sur cette page

Score d'ancrage
Score 0–1 d'un cross-encoder ou classificateur d'inférence mesurant si chaque affirmation factuelle d'une réponse du modèle est supportée par les chunks récupérés du Knowledge Graph — signal principal d'hallucination.
Dataset doré
Ensemble curé de 50–200 paires question-réponse canoniques utilisées pour détecter la dérive sémantique via régression hebdomadaire ; vérité terrain pour votre domaine et vocabulaire métier.
Dérive sémantique
Glissement progressif de la qualité, du ton ou de la précision des réponses du modèle dans le temps — causé par des changements de prompt, des modifications des données d'ancrage, ou des mises à jour silencieuses du modèle.
Dérive de prompt
Sous-ensemble de la dérive sémantique causé par l'accumulation de modifications incrémentales d'ingénierie des prompts sur plusieurs mois sans barrière de régression formelle.
Sidecar d'observabilité
Service proxy léger qui intercepte les réponses du Gateway AI Core, score l'ancrage et journalise des enregistrements structurés vers un store de séries temporelles — ajoute < 50 ms de latence.
Classificateur d'inférence
Modèle NLI qui étiquette si une hypothèse (affirmation du modèle) est entailée par, neutre par rapport à, ou contredite par une prémisse (chunk source).

Sources

  1. EU AI Act — Regulation (EU) 2024/1689 Article 9 (risk management systems)
  2. SAP AI Core — Help Portal (execution logs, model performance)
  3. Ragas — RAG evaluation framework (faithfulness, answer relevance metrics)
  4. SAP TechEd 2025 — AI observability and responsible AI session
  5. SAP Community — AI Core monitoring and operations best practices
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP — industries overview
  17. Gartner — research & analyst site
  18. BARC — BI & Analytics research
  19. TDWI — data & analytics research
  20. DSAG — German-speaking SAP user group
  21. ASUG — Americas' SAP User Group
  22. Databricks — official site
  23. SAP Help — Generative AI Hub overview
  24. NIST — AI Risk Management Framework knowledge base
  25. OpenTelemetry — Observability primer

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →