Observabilité IA — Utilisation des tokens, hallucination, dérive
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Observabilité IA — Utilisation des tokens, hallucination, dérive ?
La détection d'hallucination en production repose sur un modèle secondaire rapide (cross-encoder ou classificateur d'inférence, moins de 100 ms, moins de 10 % du coût en tokens du modèle principal) qui score chaque réponse par rapport à ses chunks d'ancrage.
De quoi il s'agit
L'observabilité de l'IA est la pratique consistant à mesurer en continu le comportement d'un système d'IA générative une fois qu'il est en production — pas avant, en démonstration, mais dans la réalité parfois désordonnée du trafic réel. Dans un contexte SAP, cela signifie surveiller trois choses en permanence : le nombre de tokens consommés par chaque appel Joule ou AI Core Model Gateway, la véracité effective des réponses données par le modèle au regard des données qui lui ont été présentées, et la question de savoir si la qualité des réponses évolue silencieusement dans le temps à mesure que les prompts sont ajustés, que les sources de grounding sont mises à jour, ou que le modèle sous-jacent est rafraîchi en coulisses par le fournisseur. Sans cette discipline, un projet qui obtenait de bons résultats lors d'un proof of concept peut se dégrader pendant des mois sans que personne ne s'en aperçoive — parce que personne ne surveille le système comme on surveille une base de données ou une interface.
Pourquoi c'est important
- Une alerte budgétaire déclenchée quand la dépense en tokens sur 7 jours glissants dépasse 110 % de la moyenne sur 30 jours détecte les dérapages avant la facture mensuelle
- Le classificateur de vérification d'ancrage tourne en moins de 100 ms et moins de 10 % du coût du modèle principal, rendant la vérification par réponse économiquement viable
- Les seuils 0,70/0,85 transforment « hallucination possible » en une décision automatique de rejet/révision/passage plutôt qu'un jugement au cas par cas
Points clés
- Trois niveaux d'observabilité : utilisation des tokens (coût), détection des hallucinations (précision de l'ancrage), dérive sémantique (stabilité des réponses dans le temps).
- Seuil de score d'ancrage : rejeter < 0,70, signaler 0,70–0,85, laisser passer > 0,85 — calibrer sur le corpus de votre domaine, pas des valeurs par défaut génériques.
- La conformité Article 9 de l'EU AI Act nécessite des journaux structurés des entrées, sorties, sources d'ancrage et scores — échéance 2026-08-02 pour les systèmes à haut risque déjà déployés.
- Suite de régression pour la dérive : 50–200 paires Q&R canoniques, exécutées hebdomadairement, alerte similarité cosine sur Δ > 0,10 par rapport à la baseline.
- Motif sidecar d'observabilité : app Python légère intercepte la réponse AI Core, score l'ancrage, journalise vers une table de séries temporelles HANA Cloud, ajoute < 50 ms de latence.
- Alerte budgétaire : dépense quotidienne en tokens sur 7 jours glissants > 110% de la moyenne sur 30 jours déclenche avant la surprise de la facture mensuelle.
- La citation sans vérification est théâtrale — les modèles hallucinent des citations presque aussi facilement que des faits.
Termes employés sur cette page
- Score d'ancrage
- Score 0–1 d'un cross-encoder ou classificateur d'inférence mesurant si chaque affirmation factuelle d'une réponse du modèle est supportée par les chunks récupérés du Knowledge Graph — signal principal d'hallucination.
- Dataset doré
- Ensemble curé de 50–200 paires question-réponse canoniques utilisées pour détecter la dérive sémantique via régression hebdomadaire ; vérité terrain pour votre domaine et vocabulaire métier.
- Dérive sémantique
- Glissement progressif de la qualité, du ton ou de la précision des réponses du modèle dans le temps — causé par des changements de prompt, des modifications des données d'ancrage, ou des mises à jour silencieuses du modèle.
- Dérive de prompt
- Sous-ensemble de la dérive sémantique causé par l'accumulation de modifications incrémentales d'ingénierie des prompts sur plusieurs mois sans barrière de régression formelle.
- Sidecar d'observabilité
- Service proxy léger qui intercepte les réponses du Gateway AI Core, score l'ancrage et journalise des enregistrements structurés vers un store de séries temporelles — ajoute < 50 ms de latence.
- Classificateur d'inférence
- Modèle NLI qui étiquette si une hypothèse (affirmation du modèle) est entailée par, neutre par rapport à, ou contredite par une prémisse (chunk source).
Sources
- EU AI Act — Regulation (EU) 2024/1689 Article 9 (risk management systems)
- SAP AI Core — Help Portal (execution logs, model performance)
- Ragas — RAG evaluation framework (faithfulness, answer relevance metrics)
- SAP TechEd 2025 — AI observability and responsible AI session
- SAP Community — AI Core monitoring and operations best practices
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- SAP Help — Generative AI Hub overview
- NIST — AI Risk Management Framework knowledge base
- OpenTelemetry — Observability primer
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.