Évaluer l'IA générative sur des données SAP
À jour au 2026-09-25
Qu'est-ce que Évaluer l'IA générative sur des données SAP ?
La fonctionnalité Evaluations de SAP AI Core est le banc d'essai pré-production pour comparer prompts et modèles sur votre propre jeu de données — huit métriques calculées (BERTScore, BLEU, ROUGE, correspondance exacte et de langue, contrôles de schéma JSON et de filtre de contenu) et huit métriques LLM-juge (respect des instructions, exactitude, ancrage RAG et qualité du contexte), plus votre propre juge personnalisé défini par une grille structurée. C129 couvre l'observation du même type de signal en production ; cette fiche couvre la construction du banc d'essai qui décide ce qui part en production.
Un banc d'essai pré-production, pas une surveillance de production
La fonctionnalité Evaluations de SAP AI Core, construite sur le scénario global genai-evaluation, est décrite par SAP comme un outillage « pour le benchmarking des grands modèles de langage et des prompts via des configurations d'orchestration » : vous évaluez des combinaisons prompt-et-modèle par rapport à un jeu de données que vous contrôlez, en comparant les options avant qu'une seule parte en production. C129 couvre une tranche plus étroite et plus tardive du même outillage — trois métriques LLM-juge utilisées pour surveiller les hallucinations et la dérive une fois une configuration déjà en production. Cette fiche couvre le banc d'essai lui-même : le catalogue complet de métriques, les métriques personnalisées, et le flux qui va d'un jeu de données enregistré à une comparaison actionnable.
Pourquoi c'est important
- Une équipe qui ne surveille que les trois métriques de production de C129 n'a aucun moyen systématique de comparer un prompt ou un modèle candidat avant sa mise en production — c'est exactement à cela que servent la fonctionnalité Evaluations et cette fiche.
- Prendre Content Filter on Input/Output pour un contrôle de filtrage plutôt qu'une métrique d'audit est une méprise facile qui fait croire à une équipe qu'elle a configuré le filtrage alors qu'elle n'a fait que mesurer si le filtrage s'est déclenché lors d'une exécution passée.
- Une métrique personnalisée avec une grille mais sans exemples travaillés produit des notes moins cohérentes — le genre d'écart de qualité qui n'apparaît qu'en comparant deux exécutions, sans pouvoir expliquer pourquoi le juge s'est contredit.
Points clés
- Evaluations s'exécute sous le scénario global genai-evaluation ; elle compare des configurations d'orchestration prompt+modèle sur votre propre jeu de données avant la production.
- 8 métriques calculées : BERTScore, BLEU, ROUGE, Exact Match (toutes nécessitent une référence) + JSON Schema Match, Content Filter on Input, Content Filter on Output, Language Match (aucune référence nécessaire).
- 8 métriques LLM-juge : Instruction Following, Correctness, Answer Relevance, Conciseness (1-5, général) + RAG Groundedness, RAG Context Relevance (1-3) + expérimentales RAG Context Precision, RAG Completeness. Aucune n'a besoin de référence.
- Les métriques personnalisées utilisent un prompt structuré : modelConfiguration, definition, evaluationTask, ratingRubric, criteria, evaluationSteps, examples.
- Flux : enregistrer l'artefact de jeu de données -> sauvegarder le prompt dans le prompt registry -> (facultatif) mapping de variables -> POST /v2/lm/configurations avec executableId genai-evaluations-simplified -> exécuter -> comparer les résultats par enregistrement et en agrégat.
- promptTemplateScope (tenant par défaut, ou resourcegroup) doit correspondre à la façon dont le modèle de prompt a été créé.
- C129 utilise 3 de ces métriques pour la surveillance des hallucinations/dérives en production ; cette fiche couvre le banc d'essai complet utilisé avant la mise en production.
- Les métriques Content Filter on Input/Output auditent si le module de filtrage s'est déclenché sur un enregistrement — elles n'exécutent pas le filtrage elles-mêmes.
Termes employés sur cette page
- genai-evaluation
- Le scénario global sous lequel s'exécute la fonctionnalité Evaluations de SAP AI Core.
- Métrique calculée
- Une métrique d'évaluation déterministe, à base de formule (par ex. BLEU, ROUGE), par opposition à une métrique LLM-juge.
- Métrique LLM-juge
- Une métrique d'évaluation notée par un LLM juge selon une grille plutôt que par comparaison de chaînes.
- Métrique personnalisée
- Une métrique LLM-juge définie par l'utilisateur, construite à partir d'un prompt structuré avec une grille de notation et des exemples travaillés.
- promptTemplateScope
- Le paramètre de configuration d'évaluation (tenant ou resourcegroup) indiquant à l'exécution où trouver le modèle du prompt registry.
- Mapping de variables
- Une configuration réconciliant des noms non correspondants entre les emplacements réservés d'un modèle de prompt et les attributs d'un jeu de données de test.
Sources
- SAP AI Core docs (SAP-docs GitHub, Sep 2026) — Evaluations (genai-evaluation scenario, use cases)
- SAP AI Core docs — System-Defined Evaluation Metrics (8 computed + 8 LLM-as-a-judge metrics, reference requirements, scales)
- SAP AI Core docs — Custom Metrics (structured prompts, rating rubric, worked example)
- SAP AI Core docs — Create an Evaluation (prerequisites, configuration parameters, promptTemplateScope)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · les pièges courants et leur correctif · l'aide-mémoire · les blocs de code · les chiffres à citer.