Portes qualité IA SAP — Seuils de précision, latence, coût et sécurité
À jour au 2026-09-27
Qu'est-ce que Portes qualité IA SAP ?
Les quality gates de l'IA sont une discipline de mise en production, pas un produit SAP : avant qu'une fonction d'IA générative ne parte en production, elle doit franchir des seuils convenus de qualité, de latence, de coût et de sécurité, mesurés sur le jeu de données du client. Le generative AI hub fournit les instruments — Evaluations avec métriques prédéfinies et LLM-as-a-judge sur mesure, optimisation de prompts, inference observability — mais c'est à vous de fixer et défendre les seuils.
Ce qu'est une quality gate — et ce que SAP fournit
Une quality gate est le critère de mise en production qui transforme une fonction probabiliste en quelque chose qu'un responsable métier peut signer : cette configuration de prompt, de modèle, de grounding et de filtres atteint telle qualité sur nos cas, répond en tel temps, coûte tant par appel et ne produit pas tels dommages. SAP ne livre pas de produit nommé « AI Quality Gates » et ne publie aucun seuil universel ; les versions précédentes de cette fiche citaient des cibles de précision, de latence et de coût qu'aucune source SAP n'étaye, et elles ont été retirées. Ce que SAP livre, dans le generative AI hub, c'est la boîte à outils de mesure.
Les instruments : Evaluations, métriques, optimisation
Evaluations « fournit des outils pour comparer modèles de langage et prompts au moyen de configurations d'orchestration » : on déclare un jeu de test dans son object store comme artefact, on choisit des métriques et on lance une exécution qui note une ou plusieurs combinaisons de prompt et de modèle — par exemple gpt-4.1 contre gpt-4o-mini avec le même modèle de prompt du registry, ou plusieurs configurations d'orchestration stockées. Les résultats se comparent d'un passage à l'autre pour détecter les régressions. La configuration utilise l'executable genai-evaluations-simplified et des paramètres comme le chemin du jeu de données, les identifiants de métriques, le déploiement d'orchestration utilisé pour les appels du juge, une correspondance de variables facultative et un nombre de lignes de test.
Pourquoi c'est important
- Sans porte écrite, le « suffisamment bon » est décidé par le dernier à faire une démo — et personne ne peut dire ensuite pourquoi une version de modèle a été admise en production.
- Montées de version de modèle, nouvelles versions de prompt, changements de grounding et replis modifient tous le comportement ; une porte non rejouée à chaque changement certifie un système qui n'existe plus.
- SAP publie des métriques et des outils, pas des seuils : des chiffres empruntés à des diapositives s'effondrent la première fois qu'un responsable métier demande d'où ils viennent.
Points clés
- Les quality gates sont une discipline de mise en production du client ; SAP fournit des outils de mesure dans le generative AI hub, pas des seuils.
- Evaluations compare des combinaisons prompt + modèle ou des configurations d'orchestration stockées sur votre jeu déclaré (executable genai-evaluations-simplified).
- Métriques calculées : BERT Score, BLEU, ROUGE, Exact Match, JSON Schema Match, Language Match, Content Filter on Input/Output.
- Métriques LLM-as-a-judge : respect des instructions, exactitude, pertinence, concision (1–5) ; groundedness et pertinence du contexte pour le RAG (1–3).
- SAP recommande les métriques de juge plutôt que la similarité calculée pour le grounding ; corrélation avec GPT-4.1 comme juge : 83,74 % / 87,07 %.
- Métriques LLM-as-a-judge sur mesure en prompts structurés ; l'optimisation de prompts réécrit le meilleur modèle dans le prompt registry.
- Latence et tokens proviennent des métadonnées d'inference observability ; le coût des taux de GenAI tokens (note SAP 3437766) convertis en capacity units.
- Rejouer la porte à chaque changement de modèle, de prompt, de grounding, de filtre ou de repli ; surveiller ensuite des échantillons de production.
Termes employés sur cette page
- Quality gate
- Critère de mise en production documenté, avec seuils de qualité, latence, coût et sécurité, qu'une configuration d'IA générative doit atteindre.
- Evaluations
- Fonction du generative AI hub qui compare prompts et modèles, sous forme de configurations d'orchestration, sur un jeu déclaré avec des métriques choisies.
- Métrique calculée
- Score déterministe comme Exact Match, BLEU, ROUGE ou JSON Schema Match, exigeant souvent une réponse de référence.
- LLM-as-a-judge
- Métrique calculée par un second LLM appliquant une grille, par exemple l'exactitude ou la groundedness RAG.
- Groundedness
- Le fait que chaque affirmation factuelle d'une réponse soit étayée par les documents de contexte fournis.
- Pertinence du contexte
- Adéquation du contexte récupéré à la question ; mesure l'étape de récupération du RAG.
- Métrique sur mesure
- Métrique LLM-as-a-judge définie par l'utilisateur sous forme de prompt structuré, avec gestion de cycle de vie.
- Optimisation de prompts
- Amélioration automatique d'un modèle de prompt du registry sur un jeu de données et une métrique cible.
Sources
- SAP AI Core — Optimizations (SAP-docs)
- SAP AI Core — Evaluations (SAP-docs)
- SAP AI Core — System-Defined Evaluation Metrics (SAP-docs)
- SAP AI Core — Validated Metrics (SAP-docs)
- SAP AI Core — Create an Evaluation (SAP-docs)
- SAP AI Core — Prompt Optimization (SAP-docs)
- SAP AI Core — Inference Observability (SAP-docs)
- SAP AI Core service guide — metering and typical consumption patterns (PDF, 4 Sep 2026)
- EU AI Act — Article 15 (accuracy, robustness, cybersecurity)
- European Commission — AI Omnibus enters into force (27 Jul 2026)
- SAP News Center — the Operational Backbone of the Autonomous Enterprise: AI Agent Hub governance at scale (2026-09)
- SAP News Center — Secure AI Agents: how SAP and NVIDIA co-define enterprise-grade agent execution (NVIDIA OpenShell, 2026-05-12)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.