Analytics Legends Die Wissensplattform für SAP Analytics
Academy-Modul

KI-Modellevaluierung

AI evaluation pipeline: golden set feeds a judged evaluation run, scored on four axes, producing a continuous production outcome — architecture diagram for AI Model Evaluation, Analytics Legends Academy module M057

Stand 2026-09-03

4 Bewertungsachsen: Genauigkeit/Faithfulness · Relevanz · Robustheit · Bias. Senior-Muster: 50-200 Prompts als Golden Set pro Skill, versioniert, bei jeder Änderung erneut ausgeführt. LLM-as-Judge für Skalierung (70-80 % Übereinstimmung mit menschlicher Bewertung bei 1-2 % der Kosten). Kontinuierliche wöchentliche Evaluierung im Produktivbetrieb, Alarm bei > 5 % Drift. Ohne Evaluierung ist jede Änderung ein Münzwurf; die KI-Funktion wird innerhalb von 6 Monaten zum unüberwachten Risiko.

Was Sie lernen

  • Ein Golden-Set-Evaluierungs-Harness entwerfen (50-200 versionierte Prompts pro Skill), das Genauigkeit/Faithfulness, Relevanz, Robustheit und Bias abdeckt
  • Eine LLM-as-Judge-Bewertungspipeline bauen und gegen menschlichen Review validieren (Ziel: 70-80 % Übereinstimmung), bevor man ihr im großen Maßstab vertraut
  • Kontinuierliche Produktionsevaluierung einplanen — mindestens wöchentlich, plus bei jeder Modell-, Prompt- oder Retrieval-Index-Änderung — mit Drift-Alerting oberhalb von 5 % Woche-über-Woche
  • Eine stratifizierte Bias-Evaluierung im Einklang mit EU-AI-Act-Art. 15 durchführen und die Abwägungen zu Golden-Set-Größe und Drift-Schwelle gegenüber einem Sponsor verteidigen

Modulüberblick

Evaluierung ist die Disziplin, die „wir haben KI ausgeliefert" von „wir haben KI ausgeliefert, die funktioniert" unterscheidet. Ein Skill oder Agent ohne dokumentierte Eval-Suite ist eine Haftung — ein Risiko, das Sie nicht messen können, eine Qualität, die Sie nicht verteidigen können, eine Regression, die Sie von Ihren Nutzern erfahren werden.

Die 4 Bewertungsachsen für SAP-Analytics-KI.

  1. Genauigkeit / Faithfulness — stimmt die Antwort mit den zugrunde liegenden Daten überein? Für gegründete Skills: 100 % faktische Treue (keine Halluzination bei Zahlen). Für RAG: Zitate stimmen mit den abgerufenen Chunks überein. Messen anhand eines Golden Set von 50-200 Fragen mit bekannter Antwort.
  2. Relevanz — beantwortet die Antwort die gestellte Frage? Zu unterscheiden von Genauigkeit: eine genaue, aber themenfremde Antwort ist nutzlos. Messen über LLM-Judge oder menschlichen Review an repräsentativen Prompts.
  3. Robustheit — degradiert das System bei Grenzfällen kontrolliert? Gegnerische Prompts, mehrdeutige Anfragen, fehlende Daten. Messen über 10-30 gegnerische Prompts pro Skill (siehe das Red-Teaming-Lab).
  4. Bias — leistet das System über geschützte Merkmale hinweg gleich (Geschlecht, Alter, Geografie, Rolle)? Messen über ein stratifiziertes Testset, EU-AI-Act-Art.-15-Mandat.

Voraussetzungen

  • Fortgeschrittene praktische Erfahrung in SAP-Analytics-Projekten
  • Zuerst die Kernkonzepte wiederholen: C087, C029, C025

Lernergebnisse

  • Ein realistisches Szenario durcharbeiten: Bank hat 3 Joule-Skills für Kreditrisiko ausgeliefert. Keine Eval-Suite. 8-wöchiges Eval-Programm.
  • Das Anti-Muster erkennen und vermeiden: kein Golden Set — keine Regressionserkennung, jede Änderung ist ein Münzwurf.
  • Die Kernentscheidung des Moduls anwenden: Eval-Frequenz — wöchentlich in Produktion für hohes Risiko wählen; bei Änderung für niedriges Risiko, nicht jährlich = unüberwachte Drift.
  • Die Beherrschung mit dem KPI verfolgen: Golden-Set-Abdeckung (Ziel: 50-200 Prompts pro Skill; Warnsignal: < 30 Prompts).

Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.

In der App öffnen →