Generative KI auf SAP-Daten evaluieren — ein Evaluationsharnisch aufbauen
Stand 2026-09-25
Praxisnaher Evaluationsharnisch für generative KI auf SAP-Daten, direkt auf der Evaluations-Fähigkeit von SAP AI Core aufgebaut. Behandelt die zwei Metrikfamilien (vordefinierte berechnete Metriken wie BERT Score, BLEU, ROUGE, JSON Schema Match, Exact Match, Language Match sowie die Content-Filter-Audit-Booleschen; und LLM-as-a-Judge-Metriken wie Pointwise Correctness, Pointwise Answer Relevance sowie die RAG-spezifischen Metriken Groundedness und Context Relevance), SAPs eigenen dokumentierten Befund, dass berechnete Metriken bei der Grounding-Evaluation schlechter abschneiden als LLM-as-a-Judge-Metriken, benutzerdefinierte Metriken über strukturierte Prompts und Bewertungsraster, die genauen Konfigurations- und Ausführungs-API-Aufrufe (genai-evaluations-simplified), das Lesen der SQLite-Rohmetrik-Ausgabe gegenüber den nachverfolgten Aggregatmetriken, sowie die vier Designentscheidungen, die aus einem Lauf einen wiederverwendbaren Harnisch machen: ein eingefrorenes Testset, eine Metrik pro Fehlermodus, ein vorab festgelegter Bestehens-Schwellenwert und ein an die Modellabkündigungen der SAP-Hinweis 3437766 gekoppelter Wiederholungsauslöser.
Was Sie lernen
- Erklären, warum berechnete Metriken (BERT Score, BLEU, ROUGE) bei der Grounding-Evaluation schlechter abschneiden als LLM-as-a-Judge-Metriken, und die von SAP dokumentierte Ersetzung anwenden
- Vordefinierte berechnete und LLM-as-a-Judge-Metriken für einen gegebenen generativen SAP-KI-Anwendungsfall wählen und eine benutzerdefinierte LLM-as-a-Judge-Metrik mit Bewertungsraster entwerfen, wenn keine passt
- Eine gültige SAP-AI-Core-Evaluationskonfiguration (genai-evaluations-simplified) mit Datenset, Metriken, Prompt- oder Orchestrierungsreferenzen bauen und deren Ausführung starten und verfolgen
- Die SQLite-Rohmetrik-Ausgabe einer Evaluation und ihre nachverfolgten Aggregatmetriken lesen und diagnostizieren, welche Testzeilen fehlschlugen und warum
- Einen wiederverwendbaren Evaluationsharnisch entwerfen: ein eingefrorenes Testset, eine Metrik pro Fehlermodus, einen vorab festgelegten Bestehens-Schwellenwert und einen an Prompt-, Modell- oder Grounding-Änderungen gekoppelten Wiederholungsauslöser
- Zwei oder mehr Modelle in einem einzigen Evaluationslauf vergleichen und eine Qualitätslücke gegen ihre GenAI-Token-Kosten abwägen, bevor ein Modell für die Produktion empfohlen wird
Modulüberblick
Für wen dieses Modul gedacht ist. Sie haben einen Prompt oder eine RAG-Pipeline im Generative AI Hub von SAP, die in der Demo gut aussieht, und einen Lenkungsausschuss, der einen Beweis will, dass es funktioniert, bevor es einen produktiven Prozess berührt. Dieses Modul liefert diesen Beweis: einen wiederholbaren Evaluationsharnisch mit der Evaluations-Fähigkeit von SAP AI Core, damit eine Modell- oder Prompt-Änderung zu einer gemessenen Entscheidung wird statt zu einem Eindruck. Es setzt M325 (Generative AI Hub in der Praxis) und die Grundlagen aus M333 voraus.
Voraussetzungen
- M333 (KI- und LLM-Grundlagen für SAP-Berater) oder gleichwertige Arbeitskenntnisse zu Tokens, RAG und den Grundlagen der Evaluation
- M325 (SAP Generative AI Hub in der Praxis) oder Sicherheit beim Erstellen einer Orchestrierungskonfiguration und eines Prompt-Templates
- Zugang zu einem Generative-AI-Hub-Tenant (oder dessen Testversion) mit der AI API, oder die Bereitschaft, API-Aufrufe auf Papier zu schreiben
- Sicherheit im Umgang mit JSON und einfachen REST-API-Aufrufen (curl oder ein HTTP-Client)
Lernergebnisse
- Vor einem Lenkungsausschuss begruenden, welche Metrikfamilie (berechnet oder LLM-as-a-Judge) zu einem gegebenen generativen SAP-KI-Anwendungsfall passt und warum.
- Eine funktionierende SAP-AI-Core-Evaluationskonfiguration und Ausfuehrungsanfrage fuer einen realen oder realistischen SAP-Anwendungsfall erstellen.
- Rohe und aggregierte Evaluationsergebnisse so genau lesen, dass die fehlgeschlagene Zeile gefunden wird, nicht nur der Durchschnittsscore.
- Einen dokumentierten, wiederholbaren Evaluationsharnisch mit eingefrorenem Testset, gewaehlten Metriken und Bestehens-Schwellenwert uebergeben.
Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.