Generative KI auf SAP-Daten evaluieren
Stand 2026-09-25
Was ist Generative KI auf SAP-Daten evaluieren?
Die Evaluations-Funktion von SAP AI Core ist das Vorproduktions-Testbett zum Vergleichen von Prompts und Modellen anhand eigener Daten — acht berechnete Metriken (BERTScore, BLEU, ROUGE, exakter Abgleich und Sprachabgleich, JSON-Schema- und Content-Filter-Prüfungen) und acht LLM-als-Richter-Metriken (Befolgung von Anweisungen, Korrektheit, RAG-Verankerung und Kontextqualität), plus ein eigener Richter nach strukturierter Bewertungsvorlage. C129 behandelt die Beobachtung desselben Signaltyps im Betrieb; diese Karte behandelt den Bau des Testbetts, das entscheidet, was überhaupt in Produktion geht.
Ein Vorproduktions-Testbett, keine Produktionsüberwachung
Die Evaluations-Funktion von SAP AI Core, aufgebaut auf dem globalen Szenario genai-evaluation, beschreibt SAP als Werkzeug „zum Benchmarking großer Sprachmodelle und Prompts über Orchestrierungskonfigurationen“: Sie bewerten Prompt-Modell-Kombinationen anhand eines selbst kontrollierten Datensatzes und vergleichen Optionen, bevor eine davon live geht. C129 behandelt einen engeren, späteren Ausschnitt desselben Werkzeugkastens — drei LLM-als-Richter-Metriken, die genutzt werden, um Halluzination und Drift zu beobachten, sobald eine Konfiguration bereits in Produktion ist. Diese Karte behandelt das Testbett selbst: den vollständigen Metrikkatalog, eigene Metriken und den Ablauf von einem registrierten Datensatz bis zu einem Vergleich, auf den Sie reagieren können.
Warum es zählt
- Ein Team, das nur C129s drei Produktionsmetriken beobachtet, hat keine systematische Möglichkeit, einen Kandidaten-Prompt oder ein Kandidatenmodell vor dem Go-live zu vergleichen — genau dafür sind die Evaluations-Funktion und diese Karte da.
- Content Filter on Input/Output für eine Filterkontrolle statt eine Audit-Metrik zu halten, ist ein leicht zu machender Fehler, der ein Team glauben lässt, es habe Filterung konfiguriert, obwohl es nur gemessen hat, ob Filterung in einem vergangenen Lauf angeschlagen hat.
- Eine eigene Metrik mit Bewertungsvorlage, aber ohne durchgerechnete Beispiele liefert weniger konsistente Bewertungen — die Art Qualitätslücke, die erst auffällt, wenn man zwei Läufe vergleicht und nicht erklären kann, warum der Richter sich selbst widersprochen hat.
Kernpunkte
- Evaluations läuft unter dem globalen Szenario genai-evaluation; es vergleicht Prompt+Modell-Orchestrierungskonfigurationen anhand eines eigenen Datensatzes vor der Produktion.
- 8 berechnete Metriken: BERTScore, BLEU, ROUGE, Exact Match (alle brauchen eine Referenz) + JSON Schema Match, Content Filter on Input, Content Filter on Output, Language Match (keine Referenz nötig).
- 8 LLM-als-Richter-Metriken: Instruction Following, Correctness, Answer Relevance, Conciseness (1-5, allgemein) + RAG Groundedness, RAG Context Relevance (1-3) + experimentell RAG Context Precision, RAG Completeness. Keine braucht eine Referenz.
- Eigene Metriken nutzen einen strukturierten Prompt: modelConfiguration, definition, evaluationTask, ratingRubric, criteria, evaluationSteps, examples.
- Ablauf: Datensatz-Artefakt registrieren -> Prompt in der Prompt Registry speichern -> (optional) Variable Mapping -> POST /v2/lm/configurations mit executableId genai-evaluations-simplified -> ausführen -> Ergebnisse pro Eintrag und aggregiert vergleichen.
- promptTemplateScope (Standard tenant, oder resourcegroup) muss dazu passen, wie die Prompt-Vorlage erstellt wurde.
- C129 nutzt 3 dieser Metriken zur Produktionsüberwachung von Halluzination/Drift; diese Karte behandelt das vollständige, vor dem Go-live genutzte Testbett.
- Content Filter on Input/Output-Metriken auditieren, ob das Filtering-Modul bei einem Eintrag angeschlagen hat — sie führen die Filterung nicht selbst aus.
Begriffe auf dieser Seite
- genai-evaluation
- Das globale Szenario, unter dem die Evaluations-Funktion von SAP AI Core läuft.
- Berechnete Metrik
- Eine deterministische, formelbasierte Evaluationsmetrik (z. B. BLEU, ROUGE) im Gegensatz zu einer LLM-als-Richter-Metrik.
- LLM-als-Richter-Metrik
- Eine Evaluationsmetrik, die von einem Richter-LLM anhand einer Bewertungsvorlage statt durch Zeichenkettenvergleich bewertet wird.
- Eigene Metrik
- Eine benutzerdefinierte LLM-als-Richter-Metrik, gebaut aus einem strukturierten Prompt mit Bewertungsvorlage und durchgerechneten Beispielen.
- promptTemplateScope
- Der Konfigurationsparameter der Evaluation (tenant oder resourcegroup), der dem Lauf sagt, wo die Prompt-Registry-Vorlage zu finden ist.
- Variable Mapping
- Eine Konfiguration, die nicht übereinstimmende Namen zwischen den Platzhaltern einer Prompt-Vorlage und den Attributen eines Testdatensatzes abgleicht.
Quellen
- SAP AI Core docs (SAP-docs GitHub, Sep 2026) — Evaluations (genai-evaluation scenario, use cases)
- SAP AI Core docs — System-Defined Evaluation Metrics (8 computed + 8 LLM-as-a-judge metrics, reference requirements, scales)
- SAP AI Core docs — Custom Metrics (structured prompts, rating rubric, worked example)
- SAP AI Core docs — Create an Evaluation (prerequisites, configuration parameters, promptTemplateScope)
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Codeblöcke · die zitierfähigen Kennzahlen.