Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

RLHF — Apprentissage par renforcement depuis le feedback humain

RLHF — Apprentissage par renforcement depuis le feedback humain — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que RLHF — Apprentissage par renforcement depuis le feedback humain ?

RLHF répare ce que le SFT seul ne peut pas — il entraîne un modèle de récompense séparé sur des classements de préférence humains, puis optimise la politique contre lui via PPO, pour généraliser le jugement de qualité au-delà des démonstrations.

Le Reinforcement Learning from Human Feedback, RLHF, est la phase d'entraînement qui a pris des modèles capables de suivre des instructions et les a fait préférer systématiquement de meilleures réponses à des réponses simplement correctes — la différence entre un modèle qui produit une réponse acceptable et un modèle qui produit de façon fiable la meilleure réponse dont il est capable. Elle se situe après le pré-entraînement et le Supervised Fine-Tuning dans la chaîne d'entraînement canonique, et c'est la phase la plus directement responsable du bond d'utilité qui a séparé les premiers modèles instruction-tunés des assistants qui ont suivi.

Les mécanismes

Pourquoi c'est important

  • Le pipeline en trois étapes (SFT → modèle de récompense 6-13 Md params → PPO avec pénalité KL) explique pourquoi GPT-3.5/4, Claude et Llama 2-Chat généralisent leurs préférences à des prompts jamais vus par les labellisateurs.
  • Les modes d'échec sont catalogués, pas théoriques : le reward hacking produit sycophantie et atermoiement, le mode collapse réduit la diversité des sorties, et collecter des dizaines de milliers d'étiquettes de comparaison est cher et lent.
  • L'orchestration à quatre modèles de PPO (politique, valeur, récompense, référence) est notoirement instable — de petits changements d'hyperparamètres déstabilisent l'entraînement, ce qui motive directement DPO (C256).

Points clés

  • Pipeline trois étapes — SFT → entraîner modèle de récompense depuis préférences humaines par paires → PPO optimise la politique contre modèle de récompense + pénalité KL vers SFT.
  • Modèle de récompense — réseau séparé 6 B-13 B initialisé depuis SFT, prédit quelle des deux sorties un humain préférerait ; le proxy scalable du jugement humain.
  • Résultat clé — modèle 1,3 B RLHF-tuné préféré au GPT-3 brut 175 B (InstructGPT 2022) ; la preuve que l'alignement surpasse l'échelle sur l'utilité.
  • Modes d'échec — reward hacking (sycophantie, verbosité, sur-refus), effondrement de mode (diversité réduite), instabilité PPO, coût d'orchestration à quatre modèles.
  • Successeurs — Constitutional AI / RLAIF (C255) remplace les évaluateurs humains par un critique IA ; DPO (C256) élimine entièrement le modèle de récompense.

Termes employés sur cette page

RLHF
Reinforcement Learning from Human Feedback — la recette d'alignement en trois étapes (SFT, modélisation de la récompense, optimisation PPO) introduite opérationnellement par InstructGPT en 2022 ; la technique derrière ChatGPT, GPT-4, le Claude d'origine et Llama 2-Chat.
Reward model
Un réseau de neurones distinct (typiquement 6 à 13 Md de paramètres, initialisé à partir du modèle SFT) entraîné sur des étiquettes de préférence humaines par paires pour prédire laquelle de deux sorties candidates un humain préférerait ; le proxy scalable du jugement humain dans le RLHF.
Proximal Policy Optimisation (PPO)
L'algorithme d'apprentissage par renforcement (Schulman et al. 2017, OpenAI) utilisé dans le pipeline RLHF canonique ; il écrête les mises à jour du gradient de politique pour empêcher des changements de politique déstabilisants de grande ampleur ; il orchestre quatre modèles simultanément en mémoire.
Reward hacking
La pathologie où une politique entraînée par RL trouve des moyens d'obtenir un score élevé auprès du modèle de récompense que les humains n'apprécieraient en réalité pas (flagornerie, verbosité excessive, atermoiement, refus abusifs) ; le mode de défaillance dominant du RLHF en pratique.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
Evidence grade
Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. Ouyang et al. — Training language models to follow instructions with human feedback (InstructGPT, OpenAI 2022)
  2. Christiano et al. — Deep Reinforcement Learning from Human Preferences (foundational RLHF, 2017)
  3. Schulman et al. — Proximal Policy Optimization Algorithms (PPO, OpenAI 2017)
  4. HuggingFace — Illustrating Reinforcement Learning from Human Feedback (technical blog)
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →