AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

RLHF — Apprentissage par renforcement depuis le feedback humain

RLHF — Apprentissage par renforcement depuis le feedback humain — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-10-04

Qu'est-ce que RLHF ?

RLHF répare ce que le SFT seul ne peut pas — il entraîne un modèle de récompense séparé sur des classements de préférence humains, puis optimise la politique contre lui via PPO, pour généraliser le jugement de qualité au-delà des démonstrations.

De quoi il s'agit

Le Reinforcement Learning from Human Feedback, RLHF, est la phase d'entraînement qui a pris des modèles capables de suivre des instructions et les a fait préférer systématiquement de meilleures réponses à des réponses simplement correctes — la différence entre un modèle qui produit une réponse acceptable et un modèle qui produit de façon fiable la meilleure réponse dont il est capable. Elle se situe après le pré-entraînement et le Supervised Fine-Tuning dans la chaîne d'entraînement canonique, et c'est la phase la plus directement responsable du bond d'utilité qui a séparé les premiers modèles instruction-tunés des assistants qui ont suivi.

Pourquoi c'est important

  • Le pipeline en trois étapes (SFT → modèle de récompense 6-13 Md params → PPO avec pénalité KL) explique pourquoi GPT-3.5/4, Claude et Llama 2-Chat généralisent leurs préférences à des prompts jamais vus par les labellisateurs.
  • Les modes d'échec sont catalogués, pas théoriques : le reward hacking produit sycophantie et atermoiement, le mode collapse réduit la diversité des sorties, et collecter des dizaines de milliers d'étiquettes de comparaison est cher et lent.
  • L'orchestration à quatre modèles de PPO (politique, valeur, récompense, référence) est notoirement instable — de petits changements d'hyperparamètres déstabilisent l'entraînement, ce qui motive directement DPO (C256).

Points clés

  • Pipeline trois étapes — SFT → entraîner modèle de récompense depuis préférences humaines par paires → PPO optimise la politique contre modèle de récompense + pénalité KL vers SFT.
  • Modèle de récompense — réseau séparé 6 B-13 B initialisé depuis SFT, prédit quelle des deux sorties un humain préférerait ; le proxy scalable du jugement humain.
  • Résultat clé — modèle 1,3 B RLHF-tuné préféré au GPT-3 brut 175 B (InstructGPT 2022) ; la preuve que l'alignement surpasse l'échelle sur l'utilité.
  • Modes d'échec — reward hacking (sycophantie, verbosité, sur-refus), effondrement de mode (diversité réduite), instabilité PPO, coût d'orchestration à quatre modèles.
  • Successeurs — Constitutional AI / RLAIF (C255) remplace les évaluateurs humains par un critique IA ; DPO (C256) élimine entièrement le modèle de récompense.
  • Le RLHF se déroule entièrement en amont chez l'éditeur du modèle de fondation — la vraie tâche d'un consultant SAP est la diligence raisonnable à son sujet, pas l'implémentation ; demander où se situe le point de contrôle human-in-the-loop d'un agent précis, pas seulement si le modèle de base a été entraîné par RLHF.
  • La gouvernance à l'exécution de SAP (NVIDIA OpenShell, la couche de gouvernance à l'exécution de Joule Studio) contraint ce qu'un modèle déjà entraîné par RLHF est autorisé à FAIRE à l'intérieur d'une boucle d'agent — elle ne réentraîne ni ne réaligne le modèle lui-même ; les deux sont des couches de contrôle séparées et complémentaires, pas substituables l'une à l'autre.

Termes employés sur cette page

RLHF
Reinforcement Learning from Human Feedback — la recette d'alignement en trois étapes (SFT, modélisation de la récompense, optimisation PPO) introduite opérationnellement par InstructGPT en 2022 ; la technique derrière ChatGPT, GPT-4, le Claude d'origine et Llama 2-Chat.
Reward model
Un réseau de neurones distinct (typiquement 6 à 13 Md de paramètres, initialisé à partir du modèle SFT) entraîné sur des étiquettes de préférence humaines par paires pour prédire laquelle de deux sorties candidates un humain préférerait ; le proxy scalable du jugement humain dans le RLHF.
Proximal Policy Optimisation (PPO)
L'algorithme d'apprentissage par renforcement (Schulman et al. 2017, OpenAI) utilisé dans le pipeline RLHF canonique ; il écrête les mises à jour du gradient de politique pour empêcher des changements de politique déstabilisants de grande ampleur ; il orchestre quatre modèles simultanément en mémoire.
Reward hacking
La pathologie où une politique entraînée par RL trouve des moyens d'obtenir un score élevé auprès du modèle de récompense que les humains n'apprécieraient en réalité pas (flagornerie, verbosité excessive, atermoiement, refus abusifs) ; le mode de défaillance dominant du RLHF en pratique.
Human-in-the-loop (SAP)
L'analogue à l'exécution de SAP à l'intuition centrale du RLHF — un point de contrôle structuré où un humain accepte, ajuste ou rejette une action proposée par l'IA avant qu'elle ne prenne effet ; l'Accounting Accruals Agent (propositions d'écritures de journal revues par un comptable) en est l'exemple livré. Distinct du RLHF : aucun modèle de récompense n'est entraîné à partir de ces décisions dans le produit SAP aujourd'hui.
Garde-fous à l'exécution contre alignement au moment de l'entraînement
Deux couches de contrôle séparées souvent confondues : le RLHF (ou la Constitutional AI) façonne les poids d'un modèle au moment de l'entraînement, en amont chez l'éditeur ; le NVIDIA OpenShell de SAP et la couche de gouvernance à l'exécution de Joule Studio contraignent ce qu'un modèle déjà entraîné est autorisé à FAIRE à l'intérieur d'une boucle d'agent gouvernée. Aucune des deux ne remplace l'autre.

Sources

  1. Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022)
  2. Christiano et al. — Deep Reinforcement Learning from Human Preferences (foundational RLHF, 2017)
  3. Schulman et al. — Proximal Policy Optimization Algorithms (PPO, OpenAI 2017)
  4. HuggingFace — Illustrating Reinforcement Learning from Human Feedback (technical blog)
  5. SAP Help Portal — generative AI hub orchestration service (content filtering, masking — runtime governance distinct from training-time RLHF)
  6. SAP Community — Knowledge graphs for LLM grounding and avoiding hallucination (contrast with RLHF as a hallucination mitigation)
  7. SAP Help Portal — SAP Accounting Accruals Agent, human-in-the-loop review step
  8. SAP Community — Automating month-end accruals with the SAP Accounting Accruals Agent
  9. SAP News Center — NVIDIA OpenShell, secure AI agent execution co-developed with SAP (2026-05-12)
  10. arXiv — Direct Preference Optimization (2305.18290), cited as RLHF's simplification successor for cross-reference
  11. Learning to summarize from human feedback — Stiennon et al., arXiv
  12. Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback — Bai et al., arXiv
  13. Scaling Laws for Reward Model Overoptimization — Gao et al., arXiv
  14. Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback — Casper et al., arXiv
  15. Llama 2: Open Foundation and Fine-Tuned Chat Models — Touvron et al., arXiv
  16. RewardBench: Evaluating Reward Models for Language Modeling — Lambert et al., arXiv

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →