AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Évaluation des LLM, benchmarks et garde-fous pour l'entreprise

Évaluation des LLM, benchmarks et garde-fous pour l'entreprise — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-10-10

Qu'est-ce que Évaluation des LLM, benchmarks et garde-fous pour l'entreprise ?

L'Article 15 du Règlement IA UE rend l'évaluation formelle juridiquement contraignante au 2027-12-02 (Omnibus numérique, en vigueur depuis le 2026-07-27) pour les cas d'usage Joule à haut risque — et BLEU/ROUGE ne suffiront pas puisque ni l'un ni l'autre ne mesure la précision factuelle.

De quoi il s'agit

Déployer un modèle de langage dans un contexte enterprise SAP sans cadre d'évaluation formel est un événement de responsabilité en attente de se produire. Dans les secteurs réglementés — banque, pharma, énergie — l'Article 15 du règlement UE sur l'IA exige que les systèmes IA à haut risque atteignent des niveaux appropriés de précision, robustesse et cybersécurité. Pour un système de décision automatisé alimenté par Joule (analyse d'éligibilité de crédit sur SAP BTP, classification d'anomalies achats dans S/4HANA), cette exigence est applicable à partir du 2027-12-02 (Omnibus numérique (en vigueur depuis le 2026-07-27) ; initialement 2026-08-02). Cette fiche couvre la chaîne d'évaluation : métriques automatisées, suites de benchmarks, red-teaming et la couche de garde-fous qui se situe entre le LLM et le processus SAP.

Les métriques automatisées de génération de texte couvrent trois dimensions. BLEU (Bilingual Evaluation Understudy) mesure le chevauchement de n-grammes entre le texte généré et le texte de référence — utile pour la traduction et les tâches de remplissage de modèles structurés, trompeur pour la génération ouverte où de nombreuses réponses valides existent. ROUGE mesure le rappel des n-grammes de référence dans le texte généré — standard pour l'évaluation des résumés (synthèses de clôture financière SAP, digests d'incidents qualité). Ni BLEU ni ROUGE ne mesurent la précision factuelle; ils ne mesurent que la similarité de surface. Pour la correction factuelle sur les tâches de connaissance SAP, utilisez la correspondance exacte ou le F1-score sur les entités extraites (codes transaction, noms de champs, codes société), pas BLEU/ROUGE.

Pourquoi c'est important

  • Pour la correction factuelle sur les tâches SAP, la correspondance exacte ou le F1-score sur les entités extraites (codes de transaction, noms de champs) est la seule métrique honnête — BLEU/ROUGE mesurent une similarité de surface, pas la justesse.
  • Un ensemble d'évaluation personnalisé de 200-500 paires question-réponse tirées des vrais flux Joule est plus honnête que HELM générique pour un usage SAP en production.
  • Le red-teaming sur quatre vecteurs d'attaque spécifiques SAP est obligatoire pour tout cas d'usage Joule touchant une transaction financière ou une décision critique.

Points clés

  • BLEU/ROUGE mesurent la similarité de surface, pas la précision factuelle — utiliser la correspondance exacte sur les entités SAP extraites pour l'évaluation factuelle.
  • HELM évalue 7 dimensions — utile comme base ; un ensemble d'évaluation personnalisé de 200-500 échantillons spécifiques au cas d'usage SAP est le benchmark de production honnête.
  • Le red-teaming couvre 4 vecteurs d'attaque SAP spécifiques : injection de prompt, jailbreaking, exfiltration de données, manipulation de logique métier — obligatoire pour tout système Joule touchant des transactions financières.
  • EU AI Act Article 15 : les systèmes IA à haut risque doivent démontrer précision, robustesse et cybersécurité — applicable à partir du 2027-12-02 pour les catégories de l'annexe III (Omnibus numérique (en vigueur depuis le 2026-07-27) ; initialement 2026-08-02).
  • Garde-fous d'entrée : bloquent injection et données personnelles avant l'appel LLM ; garde-fous de sortie : valident format, cohérence factuelle et confiance — les deux sont requis.
  • Le service de filtrage de contenu SAP AI Core (GA 2024) fournit une couche de sécurité de sortie gérée sur BTP.
  • Tester l'isolation entre agents, pas seulement la sûreté des sorties : Zenity a montré qu'un agent AgentCore public suffisait à prendre tous les agents du compte/de la région (corrigé par AWS, 8 oct. 2026).

Termes employés sur cette page

BLEU
Bilingual Evaluation Understudy — métrique mesurant la précision n-gramme d'un texte généré par rapport à des traductions de référence ; plage 0-1, plus haut est meilleur.
ROUGE
Recall-Oriented Understudy for Gisting Evaluation — métrique mesurant le rappel n-gramme du texte de référence dans la sortie générée ; standard pour l'évaluation de la synthèse (summarisation).
HELM
Holistic Evaluation of Language Models (Stanford, 2022) — cadre de benchmark évaluant les LLM sur l'exactitude, la calibration, la robustesse, l'équité, l'efficience, le biais et la toxicité.
Red-teaming
Test adversarial structuré où une équipe tente délibérément d'amener un système d'IA à produire des sorties nuisibles, erronées ou contraires aux règles.
Guardrails
Couche programmatique interceptant les entrées et sorties du LLM pour imposer la sécurité, la conformité de format, le blocage des données personnelles (PII) et les contraintes de logique métier.

Sources

  1. EU AI Act — Regulation (EU) 2024/1689, Article 15
  2. Liang et al. — Holistic Evaluation of Language Models (HELM, Stanford 2022)
  3. SAP AI Core — content filtering and responsible AI on BTP
  4. Perez et al. — Red Teaming Language Models with Language Models (2022)
  5. SAP Business AI — official product page
  6. SAP Joule (work companion) — official product page
  7. SAP Generative AI — official product page
  8. Gibson Dunn — EU AI Act: Digital Omnibus Agreement Postponed High-Risk Deadlines (2026)
  9. SAP News — Secure AI Agents: How SAP and NVIDIA Co-Define Enterprise-Grade Agent Execution (2026-05-12)
  10. SAP Help Portal — Orchestration service, content filtering and data masking modules (2026)
  11. Anthropic — Evaluation guidance (Claude platform documentation)
  12. Zou et al. — Universal and Transferable Adversarial Attacks on Aligned Language Models, arXiv:2307.15043 (2023)
  13. SAP News — Autonomous Enterprise: AI Agents Work at Scale, governance (2026-09)
  14. SAP News Center - Joule Work and the SAP Business AI Platform (8 Oct 2026)
  15. Forrester - SAP Connect 2026: four decisions CIOs must make before SAP agents execute enterprise work
  16. The Decoder - A single prompt was enough to hijack every AI agent in an AWS account, Zenity researchers found (Oct 8, 2026)
  17. CIO.com - The real agent risk that Replit’s database deletion revealed (Oct 9, 2026)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →