Constitutional AI + RLAIF — Comment Anthropic / Claude a retiré l'humain de la boucle
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Constitutional AI + RLAIF — Comment Anthropic / Claude a retiré l'humain de la boucle ?
Constitutional AI remplace les labellisateurs humains de RLHF par un critique IA qui note selon une constitution écrite et publiée — réglant à la fois le goulot de labellisation et l'opacité des préférences humaines non formulées.
La Constitutional AI, introduite par Anthropic en 2022 et affinée à travers chaque génération suivante de Claude, répond à deux faiblesses spécifiques du RLHF : le goulot d'étranglement de l'étiquetage humain, et l'opacité de préférences qui ne vivent que dans la tête des annotateurs sans être écrites nulle part. Elle règle les deux problèmes en rendant le standard explicite — une « constitution » écrite, un ensemble de principes que le modèle est entraîné à suivre — et en remplaçant les évaluateurs humains comparant des paires de réponses par un critique IA, une technique connue sous le nom de Reinforcement Learning from AI Feedback, ou RLAIF.
Comment fonctionne le pipeline en deux phases
La phase un est l'apprentissage constitutionnel supervisé. Le modèle pré-entraîné se voit présenter des consignes nuisibles ou limites, génère une réponse initiale, puis on lui demande de critiquer cette réponse au regard des principes de la constitution et de la réécrire en conséquence — identifier ce qui est nuisible, trompeur ou injuste dans cette réponse, puis la réécrire pour supprimer le problème tout en restant aussi utile que possible. Les paires consigne-et-réponse-révisée qui en résultent deviennent un jeu de données SFT, produisant un modèle déjà façonné par la constitution avant même que ne commence le moindre apprentissage par renforcement.
Pourquoi c'est important
- Pipeline en deux phases : le modèle critique et révise d'abord ses propres réponses nuisibles selon des principes explicites, puis un critique IA classe les sorties pour le RLAIF au lieu d'évaluateurs humains.
- La constitution est publique et auditable — puisée dans la Déclaration universelle des droits de l'homme, les CGU d'Apple et les principes de sécurité propres d'Anthropic — un saut de transparence par rapport aux préférences implicites des labellisateurs RLHF.
- Elle cible directement le goulot d'étranglement de labellisation de RLHF : des dizaines de milliers de comparaisons prennent des mois à collecter à qualité frontière.
Points clés
- Pipeline en deux phases — Phase 1 apprentissage constitutionnel supervisé (modèle auto-critique et révise selon principes) ; Phase 2 RLAIF (critique IA classe paires, modèle préférence entraîné, PPO optimise politique).
- Constitution — principes écrits, publics, auditables (DUDH ONU, Apple ToS, perspectives non-occidentales, sécurité Anthropic) ; explicite remplace préférences implicites de labellisateurs.
- Scale au-delà de RLHF — critique IA labellise des millions d'exemples pour le coût d'appels API, éliminant le goulot humain de plusieurs mois.
- Risques — dérive constitutionnelle (principes biaisés amplifiés à l'échelle), miscalibration de critique IA héritée ; mitigée par constitution publiée et itérée.
- Adoption — Anthropic Claude (2022 et après) ; étapes d'auto-critique Llama 3 de Meta ; Deliberative Alignment d'OpenAI pour o1 ; technique maintenant courante.
Termes employés sur cette page
- Constitutional AI (CAI)
- Technique d'alignement d'Anthropic (Bai et al. 2022) qui aligne les LLM sur un ensemble explicite et écrit de principes (« constitution ») via deux phases : auto-critique-et-révision supervisée, puis RLAIF ; la technique derrière chaque génération de Claude.
- RLAIF
- Reinforcement Learning from AI Feedback — la variante du RLHF où un critique IA (et non des annotateurs humains) classe les paires de sorties selon des principes documentés ; élimine le goulot d'étranglement de l'annotation humaine et permet le passage à l'échelle vers des millions d'étiquettes de préférence.
- Constitution (in CAI)
- L'ensemble écrit, public et auditable de principes qui régissent le comportement d'un LLM sous Constitutional AI ; celle d'Anthropic s'inspire de la DUDH de l'ONU, des CGU d'Apple, de perspectives non occidentales et des principes de sûreté d'Anthropic ; itérée ouvertement d'une génération de Claude à l'autre.
- Self-critique step
- Le mouvement d'apprentissage constitutionnel supervisé où le modèle est invité à identifier les problèmes de sa propre réponse initiale, puis à la réviser selon les principes constitutionnels ; la paire (prompt, réponse révisée) devient une donnée de SFT.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
- Evidence grade
- Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Bai et al. — Constitutional AI: Harmlessness from AI Feedback (Anthropic 2022)
- Anthropic — Claude's Constitution (public published principles)
- Lee et al. — RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback (Google 2023)
- Anthropic — Collective Constitutional AI (public deliberation on principles)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.