Analytics Legends La plateforme de connaissance SAP Analytics
Module d'académie

Évaluation des modèles IA

Schéma d'architecture du module « Évaluation des modèles IA » — Analytics Legends Academy, module M057

À jour au 2026-08-16

4 axes d'éval : exactitude · pertinence · robustesse · biais. Pattern senior : golden set 50-200 prompts par skill, versionné, relancé à chaque changement. LLM-juge pour scale (70-80 % accord humain à 1-2 % coût). Éval continue hebdomadaire en prod, alerter sur > 5 % dérive. Sans éval, chaque changement est un coup de dés; feature IA devient risque non-monitoré en 6 mois.

Ce que vous apprendrez

  • Concevoir un harnais d'évaluation golden-set (50-200 prompts versionnés par skill) couvrant exactitude/fidélité, pertinence, robustesse et biais
  • Construire et valider un pipeline de scoring LLM-as-judge contre une revue humaine (cible 70-80 % d'accord) avant de lui faire confiance à l'échelle
  • Planifier une évaluation continue en production — hebdomadaire au minimum, plus à chaque changement de modèle, de prompt ou d'index de récupération — avec alerte de dérive au-delà de 5 % semaine sur semaine
  • Mener une évaluation de biais stratifiée alignée sur l'Art. 15 de l'EU AI Act et défendre auprès d'un sponsor les arbitrages de taille du golden-set et de seuil de dérive

Aperçu du module

L'évaluation est la discipline qui sépare "on a livré l'IA" de "on a livré l'IA qui marche". Un skill ou agent sans suite d'éval documentée est une responsabilité — un risque qu'on ne peut pas mesurer, une qualité qu'on ne peut pas défendre, une régression qu'on découvrira par les utilisateurs.

Les 4 axes d'évaluation pour l'IA analytics SAP.

  1. Exactitude / fidélité — la réponse correspond-elle aux données ? Pour skills grounded : 100 % fidélité factuelle (pas d'hallucination sur chiffres). Pour RAG : citations correspondent aux chunks récupérés. Mesurer sur golden set de 50-200 questions à réponse connue.
  2. Pertinence — la réponse répond-elle à la question posée ? Distinct de l'exactitude : une réponse exacte mais hors sujet est inutile. Mesurer via LLM-juge ou revue humaine sur prompts représentatifs.
  3. Robustesse — le système dégrade-t-il gracieusement sur les cas limites ? Prompts adversariaux, demandes ambiguës, données manquantes. Mesurer via 10-30 prompts adversariaux par skill (voir le lab red-teaming).
  4. Biais — le système performe-t-il également entre attributs protégés (genre, âge, géo, rôle) ? Mesurer via test set stratifié, mandat EU AI Act Art. 15.

Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.

Ouvrir dans l'application →