RLHF — Reinforcement Learning from Human Feedback
Stand 2026-07-24T14:00:00Z
Was ist RLHF — Reinforcement Learning from Human Feedback?
RLHF behebt, was SFT nicht kann — es trainiert ein separates Reward-Modell auf menschlichen Präferenzrankings und optimiert die Policy anschließend mit PPO dagegen, wodurch Qualitätsurteile über die Demonstrationen hinaus verallgemeinert werden.
Reinforcement Learning from Human Feedback, RLHF, ist die Trainingsphase, die aus Modellen, die bereits Instruktionen befolgen konnten, Modelle machte, die konsistent bessere Antworten gegenüber bloß ausreichenden bevorzugen — der Unterschied zwischen einem Modell, das eine akzeptable Antwort produziert, und einem, das zuverlässig die beste Antwort produziert, zu der es fähig ist. Sie sitzt im kanonischen Trainings-Stack nach Pre-Training und Supervised Fine-Tuning und ist die Phase, die am unmittelbarsten für den Sprung in der Nützlichkeit verantwortlich ist, der frühe instruction-getunte Modelle von den darauffolgenden Assistenten unterschied.
Die Mechanik
RLHF läuft als dreistufige Pipeline ab, formalisiert in OpenAIs InstructGPT-Arbeit und seither in Variantenform branchenweit eingesetzt. Schritt eins ist Supervised Fine-Tuning selbst: Das Basismodell wird auf Instruktions-Antwort-Demonstrationen fein abgestimmt, um eine Ausgangs-Policy zu erzeugen, die Instruktionen bereits passabel befolgt. Schritt zwei trainiert ein Reward-Modell: Menschlichen Labellern werden Paare von Kandidatenantworten auf denselben Prompt gezeigt, und sie werden gefragt, welche besser ist; ein separates Modell, typischerweise aus dem SFT-Modell initialisiert und weit kleiner als das Frontier-Modell, das es letztlich steuern wird, wird darauf trainiert, diese Präferenz vorherzusagen. Dieses Reward-Modell wird zu einem schnellen, skalierbaren Stellvertreter für einen menschlichen Richter — einmal trainiert, kann es Millionen Kandidatenantworten bewerten, ohne dass für jede einzelne ein Mensch im Loop sein muss. Schritt drei optimiert die Policy anhand dieses Reward-Signals mittels Proximal Policy Optimization, wobei eine KL-Divergenz-Strafe die aktualisierte Policy nah am ursprünglichen SFT-Modell hält, damit sie nicht in Text abdriftet, der beim Reward-Modell gut abschneidet, sich für einen echten Menschen aber unnatürlich oder degeneriert liest.
Warum es zählt
- Die dreistufige Pipeline (SFT → Reward-Modell mit 6B-13B Parametern → PPO mit KL-Strafe) ist der Grund, warum GPT-3.5/4, Claude und Llama 2-Chat Präferenzen auf Prompts generalisieren, die Labeller nie gesehen haben.
- Die realen Fehlermodi sind katalogisiert, nicht theoretisch: Reward Hacking erzeugt Unterwürfigkeit und Absicherung, Mode Collapse verengt die Ausgabevielfalt, und das Sammeln Zehntausender Vergleichslabels ist teuer und langsam.
- Die Vier-Modell-Orchestrierung von PPO (Policy, Value, Reward, Reference) ist notorisch instabil — kleine Hyperparameter-Änderungen destabilisieren das Training, die direkte Motivation für DPO (C256).
Kernpunkte
- Dreistufige Pipeline — SFT → Reward-Modell aus menschlichen paarweisen Präferenzen trainieren → Policy mittels PPO gegen Reward-Modell + KL-Strafe zu SFT optimieren.
- Reward-Modell — separates 6B-13B-Netzwerk, aus SFT initialisiert, sagt voraus, welche von zwei Ausgaben ein Mensch bevorzugen würde; der skalierbare Stellvertreter für menschliches Urteilsvermögen.
- Zentrales Ergebnis — 1,3B RLHF-getuntes Modell gegenüber rohem 175B-GPT-3 bevorzugt (InstructGPT 2022); der Beweis, dass Alignment Skalierung bei der Nützlichkeit übertrifft.
- Fehlermodi — Reward Hacking (Unterwürfigkeit, Weitschweifigkeit, Überablehnung), Mode Collapse (reduzierte Vielfalt), PPO-Instabilität, Kosten der Vier-Modell-Orchestrierung.
- Nachfolger — Constitutional AI / RLAIF (C255) ersetzt menschliche Bewerter durch einen KI-Kritiker; DPO (C256) eliminiert das Reward-Modell vollständig.
- RLHF — Reinforcement Learning from Human Feedback ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- RLHF
- Reinforcement Learning from Human Feedback — das dreistufige Alignment-Rezept (SFT, Reward-Modellierung, PPO-Optimierung), operational eingeführt von InstructGPT 2022; die Technik hinter ChatGPT, GPT-4, dem ursprünglichen Claude, Llama 2-Chat.
- Reward-Modell
- Ein separates neuronales Netzwerk (typischerweise 6B-13B Parameter, aus dem SFT-Modell initialisiert), das auf menschlichen paarweisen Präferenzlabels trainiert wird, um vorherzusagen, welche von zwei Kandidatenantworten ein Mensch bevorzugen würde; der skalierbare Stellvertreter für menschliches Urteilsvermögen in RLHF.
- Proximal Policy Optimisation (PPO)
- Der Reinforcement-Learning-Algorithmus (Schulman et al. 2017, OpenAI), der in der kanonischen RLHF-Pipeline verwendet wird; begrenzt (clippt) Policy-Gradient-Updates, um destabilisierende große Policy-Änderungen zu verhindern; orchestriert vier Modelle gleichzeitig im Speicher.
- Reward Hacking
- Die Pathologie, bei der eine RL-trainierte Policy Wege findet, beim Reward-Modell gut abzuschneiden, obwohl Menschen das Ergebnis tatsächlich ablehnen würden (Unterwürfigkeit, übermäßige Weitschweifigkeit, Absicherung, Überablehnung); der dominante Fehlermodus von RLHF in der Praxis.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Kontrakt
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022)
- Christiano et al. — Deep Reinforcement Learning from Human Preferences (foundational RLHF, 2017)
- Schulman et al. — Proximal Policy Optimization Algorithms (PPO, OpenAI 2017)
- HuggingFace — Illustrating Reinforcement Learning from Human Feedback (technical blog)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.