Évaluer l'IA générative sur des données SAP — construire un harnais d'évaluation
À jour au 2026-09-25
Harnais d'évaluation pratique pour l'IA générative sur des données SAP, construit directement sur la fonction Evaluations de SAP AI Core. Couvre les deux familles de métriques (métriques calculées prédéfinies comme BERT Score, BLEU, ROUGE, JSON Schema Match, Exact Match, Language Match, et les booléens d'audit de filtrage de contenu ; et métriques LLM-as-a-judge comme Pointwise Correctness, Pointwise Answer Relevance et les métriques RAG Groundedness et Context Relevance), le constat documenté par SAP lui-même selon lequel les métriques calculées sont moins performantes que les métriques LLM-as-a-judge pour l'évaluation du grounding, les métriques personnalisées via prompts structurés et référentiels de notation, les appels d'API exacts de configuration et d'exécution (genai-evaluations-simplified), la lecture de la sortie SQLite des métriques brutes face aux métriques agrégées suivies, et les quatre choix de conception qui transforment une exécution isolée en un harnais réutilisable : un jeu de test figé, une métrique par mode de défaillance, un seuil de réussite déclaré à l'avance et un déclencheur de relance lié aux retraits de modèles de la note SAP 3437766.
Ce que vous apprendrez
- Expliquer pourquoi les métriques calculées (BERT Score, BLEU, ROUGE) sont moins performantes que les métriques LLM-as-a-judge pour l'évaluation du grounding, et appliquer la substitution documentée par SAP
- Choisir des métriques calculées et LLM-as-a-judge prédéfinies pour un cas d'usage d'IA générative SAP donné, et concevoir une métrique personnalisée LLM-as-a-judge avec un référentiel de notation quand aucune ne convient
- Construire une configuration d'évaluation SAP AI Core valide (genai-evaluations-simplified) avec jeu de données, métriques, références de prompt ou d'orchestration, puis lancer et suivre son exécution
- Lire la sortie SQLite des métriques brutes d'une évaluation et ses métriques agrégées suivies, et diagnostiquer quelles lignes de test ont échoué et pourquoi
- Concevoir un harnais d'évaluation réutilisable : un jeu de test figé, une métrique par mode de défaillance, un seuil de réussite déclaré à l'avance, et un déclencheur de relance lié aux changements de prompt, de modèle ou de grounding
- Comparer deux modèles ou plus en une seule exécution d'évaluation et mettre en balance un écart de qualité et son coût en GenAI tokens avant de recommander un modèle pour la production
Aperçu du module
À qui s'adresse ce module. Vous disposez d'un prompt ou d'un pipeline RAG dans le generative AI hub de SAP qui a fière allure en démonstration, et d'un comité de pilotage qui veut une preuve que cela fonctionne avant que cela ne touche un processus en production. Ce module construit cette preuve : un harnais d'évaluation reproductible à partir de la fonction Evaluations de SAP AI Core, pour qu'un changement de modèle ou de prompt devienne une décision mesurée plutôt qu'une impression. Il suppose acquis M325 (generative AI hub en pratique) et les fondamentaux de M333.
Prérequis
- M333 (Fondamentaux IA et LLM pour consultants SAP) ou une maîtrise équivalente des tokens, du RAG et des bases de l'évaluation
- M325 (SAP Generative AI Hub en pratique) ou l'aisance à créer une configuration d'orchestration et un template de prompt
- Un accès à un tenant du generative AI hub (ou à son essai) avec l'AI API, ou la volonté d'écrire les appels d'API sur papier
- Aisance avec le JSON et les appels d'API REST de base (curl ou un client HTTP)
Acquis
- Justifier, devant un comité de pilotage, quelle famille de métriques (calculée ou LLM-as-a-judge) convient à un cas d'usage d'IA générative SAP donné, et pourquoi.
- Produire une configuration d'évaluation SAP AI Core fonctionnelle et une requête d'exécution pour un cas d'usage SAP réel ou réaliste.
- Lire les résultats bruts et agrégés d'une évaluation assez précisément pour localiser la ligne en échec, pas seulement le score moyen.
- Transmettre un harnais d'évaluation documenté et rejouable, avec un jeu de test figé, des métriques choisies et un seuil de réussite.
Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.