AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

DPO — Direct Preference Optimization (RLHF sans le RL)

DPO — Direct Preference Optimization (RLHF sans le RL) — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-10-06

Qu'est-ce que DPO — Direct Preference Optimization (RLHF sans le RL) ?

DPO élimine complètement le modèle de récompense et PPO — une substitution en forme fermée permet d'entraîner la politique directement sur des triplets de préférence (choisi, rejeté) avec une simple loss de classification, environ 2 à 3 fois moins cher que RLHF.

Ce que c'est et pourquoi cela compte

Direct Preference Optimization, ou DPO, est la technique d'alignement publiée par une équipe de recherche de Stanford en 2023, devenue discrètement la méthode par défaut pour aligner un modèle de langage en dehors des tout premiers laboratoires d'IA. Avant DPO, la voie standard vers l'alignement était l'apprentissage par renforcement à partir de retours humains (RLHF) : on collecte des paires de réponses générées par le modèle, des humains classent laquelle est la meilleure, on entraîne un modèle de récompense séparé pour prédire ce classement, puis on exécute un algorithme d'apprentissage par renforcement (typiquement Proximal Policy Optimization) qui pousse le modèle de langage vers les réponses que le modèle de récompense note favorablement, tout en gardant, via un terme de pénalité, une proximité avec son comportement de départ. Ce pipeline fonctionne, mais il est lourd : quatre modèles en jeu simultanément (la politique en cours d'entraînement, une copie de référence figée, le modèle de récompense, et souvent un modèle de valeur), une boucle d'apprentissage par renforcement notoirement délicate à régler, et un risque réel que la politique apprenne à exploiter les failles du modèle de récompense plutôt que de réellement s'améliorer.

Pourquoi c'est important

  • Le coup mathématique (politique optimale en forme fermée exprimée comme un log-ratio contre un modèle de référence) réduit l'orchestration à quatre modèles de RLHF à deux modèles et une seule passe forward-backward.
  • Il supprime d'un coup les deux plus gros points de douleur opérationnels de RLHF — instabilité PPO et exploitation du modèle de récompense — puisqu'il n'y a plus ni modèle de récompense ni boucle RL à exploiter.
  • La parité de qualité est démontrée, pas supposée : DPO égale RLHF sur les benchmarks Helpful-Harmless d'Anthropic et OpenAssistant, validé par Zephyr-7B et Tulu 2/3 sur des modèles ouverts.

Points clés

  • Intuition mathématique — la politique optimale RLHF a une forme fermée ; substituer dans le modèle de préférence Bradley-Terry donne une loss de classification directe sur triplets (prompt, choisi, rejeté).
  • Pipeline — pas de modèle de récompense, pas de PPO ; seulement politique + référence gelée, une seule passe forward-backward sur les données triplets.
  • Coût — 2 à 3 fois moins cher que RLHF de qualité équivalente ; complexité d'ingénierie plus proche du SFT que du RL.
  • Qualité — égale RLHF sur Anthropic HH + OpenAssistant à échelle comparable ; défaut pour presque chaque recette d'alignement open-weight depuis mi-2023 (Zephyr-7B, Tulu 2/3, variantes Llama 3, Mistral, Qwen, Gemma).
  • Variantes + limites — IPO, KTO, ORPO adressent des modes d'échec spécifiques ; moins robuste que RLHF/CAI à l'échelle frontière ; l'hypothèse Bradley-Terry peut échouer sur données de préférence bruyantes.
  • Séquencement en entreprise — sur SAP AI Core, ne recourir au DPO qu'après que le prompting/ancrage (service d'orchestration) et le LoRA/QLoRA (C258) échouent à verrouiller un comportement comparatif répétable ; le generative AI hub de SAP privilégie par défaut l'orchestration en premier.
  • DPO a besoin d'une politique de départ déjà affinée par SFT, pas d'un modèle de base brut — sauter l'amorçage supervisé dégrade la qualité car le modèle de référence lui-même est sous-entraîné.
  • Aucune recette DPO publiée par SAP n'existe pour les SAP Domain Models (SAP-ABAP-2) à septembre 2026 — c'est une technique pour modèle à poids ouverts ou auto-hébergé, pas une capacité produit SAP documentée ; ne pas la présenter comme telle.

Termes employés sur cette page

Direct Preference Optimization (DPO)
Technique d'alignement de Stanford (Rafailov et al. 2023) qui entraîne un LLM directement sur des triplets de préférence (prompt, choisi, rejeté) via une simple perte de classification dérivée de la solution en forme close de l'objectif RLHF ; élimine le modèle de récompense et le PPO.
Bradley-Terry preference model
Le modèle statistique qui exprime la probabilité de préférence par paires comme fonction de scores de qualité latents ; tant le RLHF (via le modèle de récompense) que le DPO (directement) s'entraînent contre ce modèle.
Preference triple
Un exemple d'entraînement pour le DPO de la forme (prompt, réponse choisie, réponse rejetée) ; les comparaisons d'annotateurs seniors entre deux sorties du modèle pour un même prompt les produisent directement.
KTO / IPO / ORPO
Trois variantes notables du DPO — Kahneman-Tversky Optimisation (ContextualAI 2024, robuste à la distribution), Identity Preference Optimisation (recherche affiliée DeepMind, Azar et al. 2023, correctif de surconfiance), Odds Ratio Preference Optimisation (Hong et al. 2024, SFT+préférence combinés) ; chacune traite un mode de défaillance spécifique du DPO.
Reference model
Une copie gelée de la politique pré-DPO (généralement le checkpoint SFT) utilisée uniquement pour calculer le ratio de log-probabilité dans la loss DPO ; elle ne reçoit jamais de mise à jour de gradient et ancre jusqu'où la politique entraînée est autorisée à dériver.
SFT warm-start
La passe de fine-tuning supervisé qui doit précéder le DPO ; DPO suppose qu'il affine les préférences d'une politique déjà compétente, pas qu'il enseigne la tâche sous-jacente depuis zéro, donc sauter cette étape prive à la fois la politique et le modèle de référence d'une compétence de base.
RLAIF (Reinforcement Learning from AI Feedback)
Une approche d'étiquetage de préférence, utilisée dans le Constitutional AI d'Anthropic, où un modèle d'IA plutôt qu'un humain classe des réponses candidates selon un ensemble de principes ; alimente le même format de triplet (choisi, rejeté) que celui sur lequel s'entraîne DPO, à une fraction du coût d'étiquetage humain.

Sources

  1. Rafailov et al. — Direct Preference Optimization: Your Language Model is Secretly a Reward Model (Stanford, NeurIPS 2023)
  2. Tunstall et al. — Zephyr: Direct Distillation of LM Alignment (HuggingFace 2023)
  3. Ivison et al. — Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2 (AI2 2023)
  4. HuggingFace TRL library — DPO implementation and tutorials
  5. arXiv — Ethayarajh et al., "KTO: Model Alignment as Prospect Theoretic Optimization" (2024-02-02, fetched 2026-09-27)
  6. arXiv — Azar et al., "A General Theoretical Paradigm to Understand Learning from Human Preferences" — the ΨPO/IPO paper (2023-10-18, fetched 2026-09-27)
  7. arXiv — Hong et al., "ORPO: Monolithic Preference Optimization without Reference Model" (2024-03-12, fetched 2026-09-27)
  8. arXiv — Bai et al. (Anthropic), "Constitutional AI: Harmlessness from AI Feedback" (2022-12-15, fetched 2026-09-27)
  9. SAP Help Portal — Orchestration service in the generative AI hub, SAP AI Core (fetched 2026-09-27)
  10. SAP Help Portal — generative AI hub overview, SAP AI Core (fetched 2026-09-27)
  11. SAP News Center — SAP and Anthropic to bring Claude to the SAP Business AI Platform (2026-05-12)
  12. Hugging Face PEFT documentation — LoRA configuration reference for pairing adapters with DPO (fetched 2026-09-27)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →