Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

RLHF — Reinforcement Learning from Human Feedback

RLHF — Reinforcement Learning from Human Feedback — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist RLHF — Reinforcement Learning from Human Feedback?

RLHF behebt, was SFT nicht kann — es trainiert ein separates Reward-Modell auf menschlichen Präferenzrankings und optimiert die Policy anschließend mit PPO dagegen, wodurch Qualitätsurteile über die Demonstrationen hinaus verallgemeinert werden.

Reinforcement Learning from Human Feedback, RLHF, ist die Trainingsphase, die aus Modellen, die bereits Instruktionen befolgen konnten, Modelle machte, die konsistent bessere Antworten gegenüber bloß ausreichenden bevorzugen — der Unterschied zwischen einem Modell, das eine akzeptable Antwort produziert, und einem, das zuverlässig die beste Antwort produziert, zu der es fähig ist. Sie sitzt im kanonischen Trainings-Stack nach Pre-Training und Supervised Fine-Tuning und ist die Phase, die am unmittelbarsten für den Sprung in der Nützlichkeit verantwortlich ist, der frühe instruction-getunte Modelle von den darauffolgenden Assistenten unterschied.

Die Mechanik

RLHF läuft als dreistufige Pipeline ab, formalisiert in OpenAIs InstructGPT-Arbeit und seither in Variantenform branchenweit eingesetzt. Schritt eins ist Supervised Fine-Tuning selbst: Das Basismodell wird auf Instruktions-Antwort-Demonstrationen fein abgestimmt, um eine Ausgangs-Policy zu erzeugen, die Instruktionen bereits passabel befolgt. Schritt zwei trainiert ein Reward-Modell: Menschlichen Labellern werden Paare von Kandidatenantworten auf denselben Prompt gezeigt, und sie werden gefragt, welche besser ist; ein separates Modell, typischerweise aus dem SFT-Modell initialisiert und weit kleiner als das Frontier-Modell, das es letztlich steuern wird, wird darauf trainiert, diese Präferenz vorherzusagen. Dieses Reward-Modell wird zu einem schnellen, skalierbaren Stellvertreter für einen menschlichen Richter — einmal trainiert, kann es Millionen Kandidatenantworten bewerten, ohne dass für jede einzelne ein Mensch im Loop sein muss. Schritt drei optimiert die Policy anhand dieses Reward-Signals mittels Proximal Policy Optimization, wobei eine KL-Divergenz-Strafe die aktualisierte Policy nah am ursprünglichen SFT-Modell hält, damit sie nicht in Text abdriftet, der beim Reward-Modell gut abschneidet, sich für einen echten Menschen aber unnatürlich oder degeneriert liest.

Warum es zählt

  • Die dreistufige Pipeline (SFT → Reward-Modell mit 6B-13B Parametern → PPO mit KL-Strafe) ist der Grund, warum GPT-3.5/4, Claude und Llama 2-Chat Präferenzen auf Prompts generalisieren, die Labeller nie gesehen haben.
  • Die realen Fehlermodi sind katalogisiert, nicht theoretisch: Reward Hacking erzeugt Unterwürfigkeit und Absicherung, Mode Collapse verengt die Ausgabevielfalt, und das Sammeln Zehntausender Vergleichslabels ist teuer und langsam.
  • Die Vier-Modell-Orchestrierung von PPO (Policy, Value, Reward, Reference) ist notorisch instabil — kleine Hyperparameter-Änderungen destabilisieren das Training, die direkte Motivation für DPO (C256).

Kernpunkte

  • Dreistufige Pipeline — SFT → Reward-Modell aus menschlichen paarweisen Präferenzen trainieren → Policy mittels PPO gegen Reward-Modell + KL-Strafe zu SFT optimieren.
  • Reward-Modell — separates 6B-13B-Netzwerk, aus SFT initialisiert, sagt voraus, welche von zwei Ausgaben ein Mensch bevorzugen würde; der skalierbare Stellvertreter für menschliches Urteilsvermögen.
  • Zentrales Ergebnis — 1,3B RLHF-getuntes Modell gegenüber rohem 175B-GPT-3 bevorzugt (InstructGPT 2022); der Beweis, dass Alignment Skalierung bei der Nützlichkeit übertrifft.
  • Fehlermodi — Reward Hacking (Unterwürfigkeit, Weitschweifigkeit, Überablehnung), Mode Collapse (reduzierte Vielfalt), PPO-Instabilität, Kosten der Vier-Modell-Orchestrierung.
  • Nachfolger — Constitutional AI / RLAIF (C255) ersetzt menschliche Bewerter durch einen KI-Kritiker; DPO (C256) eliminiert das Reward-Modell vollständig.
  • RLHF — Reinforcement Learning from Human Feedback ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
  • Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

RLHF
Reinforcement Learning from Human Feedback — das dreistufige Alignment-Rezept (SFT, Reward-Modellierung, PPO-Optimierung), operational eingeführt von InstructGPT 2022; die Technik hinter ChatGPT, GPT-4, dem ursprünglichen Claude, Llama 2-Chat.
Reward-Modell
Ein separates neuronales Netzwerk (typischerweise 6B-13B Parameter, aus dem SFT-Modell initialisiert), das auf menschlichen paarweisen Präferenzlabels trainiert wird, um vorherzusagen, welche von zwei Kandidatenantworten ein Mensch bevorzugen würde; der skalierbare Stellvertreter für menschliches Urteilsvermögen in RLHF.
Proximal Policy Optimisation (PPO)
Der Reinforcement-Learning-Algorithmus (Schulman et al. 2017, OpenAI), der in der kanonischen RLHF-Pipeline verwendet wird; begrenzt (clippt) Policy-Gradient-Updates, um destabilisierende große Policy-Änderungen zu verhindern; orchestriert vier Modelle gleichzeitig im Speicher.
Reward Hacking
Die Pathologie, bei der eine RL-trainierte Policy Wege findet, beim Reward-Modell gut abzuschneiden, obwohl Menschen das Ergebnis tatsächlich ablehnen würden (Unterwürfigkeit, übermäßige Weitschweifigkeit, Absicherung, Überablehnung); der dominante Fehlermodus von RLHF in der Praxis.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Kontrakt
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022)
  2. Christiano et al. — Deep Reinforcement Learning from Human Preferences (foundational RLHF, 2017)
  3. Schulman et al. — Proximal Policy Optimization Algorithms (PPO, OpenAI 2017)
  4. HuggingFace — Illustrating Reinforcement Learning from Human Feedback (technical blog)
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →