AI & Analytics Legends Die Wissensplattform für SAP Analytics
Academy-Modul

Post-Training und Fine-Tuning — SFT, RLHF, Constitutional AI, DPO und LoRA, und wann ein SAP-Team überhaupt feinabstimmen sollte

Post-Training und Fine-Tuning — SFT, RLHF, Constitutional AI, DPO und LoRA, und wann ein SAP-Team überhaupt feinabstimmen sollte — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-10-04

Erklärt, wie Modelle nach dem Pretraining zu Assistenten werden (überwachtes Fine-Tuning, RLHF, Constitutional AI und RLAIF, DPO), wie LoRA und QLoRA Anpassung bezahlbar machen und was SAP zu SAP AI Core dokumentiert: Nutzung und Orchestrierung von Anbietermodellen, Grounding, Prompt-Optimierung, das von SAP trainierte SAP-ABAP-1, In-Context-Vorhersage mit SAP-RPT-1 und die Einschränkung bei der Erzeugung synthetischer Trainingsdaten. Danach folgt ein Entscheidungsrahmen für RAG gegen Fine-Tuning gegen In-Context-Learning, gestützt auf veröffentlichte Belege (RAG schlägt Fine-Tuning bei Fakten; LIMA und LoRA beim Verhalten) und eine ehrliche Kosten- und Aufwandsbetrachtung, in der Daten, Evaluierung, Betrieb und Auslaufen des Basismodells dominieren. Das Labor endet in einem Memo „feinabstimmen oder nicht“.

Was Sie lernen

  • Pretraining, überwachtes Fine-Tuning, RLHF, Constitutional AI/RLAIF, DPO und fortgesetztes Pretraining im Modelllebenszyklus verorten und sagen, welchen Vorgang eine Kundenanfrage tatsächlich beschreibt
  • Die drei RLHF-Schritte (SFT, Reward-Modell, PPO mit KL-Strafe) erklären und warum Reward-Überoptimierung es zu einer Aufgabe des Modellanbieters macht
  • Die zwei Phasen von Constitutional AI und RLAIF sowie den DPO-Verlust auf gewählten und abgelehnten Paaren gegen ein eingefrorenes Referenzmodell erklären
  • LoRA und QLoRA (eingefrorene Basis, trainierbare Matrizen niedrigen Rangs, quantisierte Basis) und die betrieblichen Folgen erklären: kleine austauschbare Adapter, Vergessen und Qualitätsgrenzen
  • Die SAP-Dokumentation präzise lesen: was der Generative AI Hub bietet (Nutzung, Orchestrierung, Grounding, Prompt-Optimierung), was SAP selbst feinabgestimmt hat (SAP-ABAP-1), wo In-Context-Learning das Training ersetzt (SAP-RPT-1) und die Einschränkung zu synthetischen Trainingsdaten
  • Einen Entscheidungsrahmen (RAG gegen Fine-Tuning gegen In-Context-Learning) mit Goldstandard und ehrlicher Kosten- und Aufwandsschätzung anwenden und ein Memo „feinabstimmen oder nicht“ schreiben

Modulüberblick

Für wen dieses Modul ist. Sie können einen geerdeten Assistenten auf dem SAP Generative AI Hub bauen, und nun hat man Ihnen die Frage gestellt, die jedes SAP-KI-Team hört: „Sollen wir das Modell mit unseren Daten feinabstimmen?“ Dieses Modul erklärt, wie Modelle nach dem Pretraining hilfreich und sicher werden (überwachtes Fine-Tuning, RLHF, Constitutional AI, DPO), wie parametereffizientes Fine-Tuning mit LoRA funktioniert und was SAP auf SAP AI Core tatsächlich anbietet, damit Sie mit einer Entscheidung antworten statt mit einem Reflex. Vorausgesetzt wird M333 (KI- und LLM-Grundlagen); hilfreich sind M391 (LLM-Interna), M325 (Generative AI Hub in der Praxis) und M365 (LLM-Kostensteuerung). Das Modul ist bewusst skeptisch: Für die meisten SAP-Wissensprobleme ist Fine-Tuning das falsche Werkzeug, und es zeigt das mit Belegen. Primärquellen sind die Originalarbeiten und die Anbieterdokumentation; Kosten- und Aufwandsangaben, die SAP nicht veröffentlicht, sind als redaktionelle Planungsschätzungen gekennzeichnet.

Voraussetzungen

  • Abschluss von M333 (KI- und LLM-Grundlagen für SAP-Berater) oder gleichwertige Kenntnisse zu Tokens, Embeddings, Grounding und Kontext
  • Empfohlen: M391 (LLM-Interna für SAP-Architekten) für Hintergrund zu Attention, KV-Cache und Quantisierung
  • Optional: Zugang zu einem SAP-AI-Core-Tenant mit erweitertem Plan oder die SAP-Dokumentation zu Generative AI Hub, Orchestrierung und Grounding, um die Basismessungen im Labor auszuführen

Lernergebnisse

  • Genau benennen, welche Art von Anpassung eine Kundenanfrage beschreibt (Stil, Aufgabe, Fakten, Sicherheit) und welche Methode, falls überhaupt, sie adressiert.
  • RLHF, Constitutional AI, DPO und LoRA einem technischen Sponsor je in zwei Minuten mit den richtigen Abwägungen erklären.
  • Beschreiben, was SAP AI Core heute für Modellnutzung, von SAP trainierte Modelle und In-Context-Vorhersage dokumentiert, ohne einen verwalteten Fine-Tuning-Dienst zu versprechen, den die geprüfte Dokumentation nicht beschreibt.
  • Einen Goldstandard-Vergleich von Prompt, Few-Shot, Grounding und (falls gerechtfertigt) einem LoRA-Piloten durchführen und das Ergebnis vertreten.
  • Ein Memo „feinabstimmen oder nicht“ mit ehrlicher Kosten- und Aufwandsschätzung schreiben, die Daten, Evaluierung, Betrieb und Modellauslauf einschließt.

Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.

In der App öffnen →