KI-Modellevaluierung
Stand 2026-09-03
4 Bewertungsachsen: Genauigkeit/Faithfulness · Relevanz · Robustheit · Bias. Senior-Muster: 50-200 Prompts als Golden Set pro Skill, versioniert, bei jeder Änderung erneut ausgeführt. LLM-as-Judge für Skalierung (70-80 % Übereinstimmung mit menschlicher Bewertung bei 1-2 % der Kosten). Kontinuierliche wöchentliche Evaluierung im Produktivbetrieb, Alarm bei > 5 % Drift. Ohne Evaluierung ist jede Änderung ein Münzwurf; die KI-Funktion wird innerhalb von 6 Monaten zum unüberwachten Risiko.
Was Sie lernen
- Ein Golden-Set-Evaluierungs-Harness entwerfen (50-200 versionierte Prompts pro Skill), das Genauigkeit/Faithfulness, Relevanz, Robustheit und Bias abdeckt
- Eine LLM-as-Judge-Bewertungspipeline bauen und gegen menschlichen Review validieren (Ziel: 70-80 % Übereinstimmung), bevor man ihr im großen Maßstab vertraut
- Kontinuierliche Produktionsevaluierung einplanen — mindestens wöchentlich, plus bei jeder Modell-, Prompt- oder Retrieval-Index-Änderung — mit Drift-Alerting oberhalb von 5 % Woche-über-Woche
- Eine stratifizierte Bias-Evaluierung im Einklang mit EU-AI-Act-Art. 15 durchführen und die Abwägungen zu Golden-Set-Größe und Drift-Schwelle gegenüber einem Sponsor verteidigen
Modulüberblick
Evaluierung ist die Disziplin, die „wir haben KI ausgeliefert" von „wir haben KI ausgeliefert, die funktioniert" unterscheidet. Ein Skill oder Agent ohne dokumentierte Eval-Suite ist eine Haftung — ein Risiko, das Sie nicht messen können, eine Qualität, die Sie nicht verteidigen können, eine Regression, die Sie von Ihren Nutzern erfahren werden.
Die 4 Bewertungsachsen für SAP-Analytics-KI.
- Genauigkeit / Faithfulness — stimmt die Antwort mit den zugrunde liegenden Daten überein? Für gegründete Skills: 100 % faktische Treue (keine Halluzination bei Zahlen). Für RAG: Zitate stimmen mit den abgerufenen Chunks überein. Messen anhand eines Golden Set von 50-200 Fragen mit bekannter Antwort.
- Relevanz — beantwortet die Antwort die gestellte Frage? Zu unterscheiden von Genauigkeit: eine genaue, aber themenfremde Antwort ist nutzlos. Messen über LLM-Judge oder menschlichen Review an repräsentativen Prompts.
- Robustheit — degradiert das System bei Grenzfällen kontrolliert? Gegnerische Prompts, mehrdeutige Anfragen, fehlende Daten. Messen über 10-30 gegnerische Prompts pro Skill (siehe das Red-Teaming-Lab).
- Bias — leistet das System über geschützte Merkmale hinweg gleich (Geschlecht, Alter, Geografie, Rolle)? Messen über ein stratifiziertes Testset, EU-AI-Act-Art.-15-Mandat.
Voraussetzungen
- Fortgeschrittene praktische Erfahrung in SAP-Analytics-Projekten
- Zuerst die Kernkonzepte wiederholen: C087, C029, C025
Lernergebnisse
- Ein realistisches Szenario durcharbeiten: Bank hat 3 Joule-Skills für Kreditrisiko ausgeliefert. Keine Eval-Suite. 8-wöchiges Eval-Programm.
- Das Anti-Muster erkennen und vermeiden: kein Golden Set — keine Regressionserkennung, jede Änderung ist ein Münzwurf.
- Die Kernentscheidung des Moduls anwenden: Eval-Frequenz — wöchentlich in Produktion für hohes Risiko wählen; bei Änderung für niedriges Risiko, nicht jährlich = unüberwachte Drift.
- Die Beherrschung mit dem KPI verfolgen: Golden-Set-Abdeckung (Ziel: 50-200 Prompts pro Skill; Warnsignal: < 30 Prompts).
Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.