AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Constitutional AI + RLAIF — Comment Anthropic / Claude a retiré l'humain de la boucle

Constitutional AI + RLAIF — Comment Anthropic / Claude a retiré l'humain de la boucle — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-10-04

Qu'est-ce que Constitutional AI + RLAIF ?

Constitutional AI remplace les labellisateurs humains de RLHF par un critique IA qui note selon une constitution écrite et publiée — réglant à la fois le goulot de labellisation et l'opacité des préférences humaines non formulées.

La Constitutional AI, introduite par Anthropic en 2022 et affinée à travers chaque génération suivante de Claude, répond à deux faiblesses spécifiques du RLHF : le goulot d'étranglement de l'étiquetage humain, et l'opacité de préférences qui ne vivent que dans la tête des annotateurs sans être écrites nulle part. Elle règle les deux problèmes en rendant le standard explicite — une « constitution » écrite, un ensemble de principes que le modèle est entraîné à suivre — et en remplaçant les évaluateurs humains comparant des paires de réponses par un critique IA, une technique connue sous le nom de Reinforcement Learning from AI Feedback, ou RLAIF.

Comment fonctionne le pipeline en deux phases

La phase un est l'apprentissage constitutionnel supervisé. Le modèle pré-entraîné se voit présenter des consignes nuisibles ou limites, génère une réponse initiale, puis on lui demande de critiquer cette réponse au regard des principes de la constitution et de la réécrire en conséquence — identifier ce qui est nuisible, trompeur ou injuste dans cette réponse, puis la réécrire pour supprimer le problème tout en restant aussi utile que possible. Les paires consigne-et-réponse-révisée qui en résultent deviennent un jeu de données SFT, produisant un modèle déjà façonné par la constitution avant même que ne commence le moindre apprentissage par renforcement.

Pourquoi c'est important

  • Pipeline en deux phases : le modèle critique et révise d'abord ses propres réponses nuisibles selon des principes explicites, puis un critique IA classe les sorties pour le RLAIF au lieu d'évaluateurs humains.
  • La constitution est publique et auditable — puisée dans la Déclaration universelle des droits de l'homme, les CGU d'Apple et les principes de sécurité propres d'Anthropic — un saut de transparence par rapport aux préférences implicites des labellisateurs RLHF.
  • Elle cible directement le goulot d'étranglement de labellisation de RLHF : des dizaines de milliers de comparaisons prennent des mois à collecter à qualité frontière.

Points clés

  • Pipeline en deux phases — Phase 1 apprentissage constitutionnel supervisé (modèle auto-critique et révise selon principes) ; Phase 2 RLAIF (critique IA classe paires, modèle préférence entraîné, PPO optimise politique).
  • Constitution — principes écrits, publics, auditables (DUDH ONU, Apple ToS, perspectives non-occidentales, sécurité Anthropic) ; explicite remplace préférences implicites de labellisateurs.
  • Scale au-delà de RLHF — critique IA labellise des millions d'exemples pour le coût d'appels API, éliminant le goulot humain de plusieurs mois.
  • Risques — dérive constitutionnelle (principes biaisés amplifiés à l'échelle), miscalibration de critique IA héritée ; mitigée par constitution publiée et itérée.
  • Adoption — Anthropic Claude (2022 et après) ; étapes d'auto-critique Llama 3 de Meta ; Deliberative Alignment d'OpenAI pour o1 ; technique maintenant courante.
  • Le partenariat SAP+Anthropic rend cela concret, pas hypothétique, pour un consultant SAP — Claude est positionné comme une capacité de raisonnement/agentique primaire à travers Joule et les agents Joule (RH, achats, supply chain), connectée via MCP, lisant le Knowledge Graph de SAP pour le contexte métier.
  • La constitution publiée d'Anthropic est généraliste et ne dit rien des normes de processus propres à SAP (clean-core, masquage de données RH, conventions ABAP) — elle complète mais ne remplace jamais la propre gouvernance à l'exécution de SAP (OpenShell, gouvernance Joule Studio) ni la revue human-in-the-loop (C254).

Termes employés sur cette page

Constitutional AI (CAI)
Technique d'alignement d'Anthropic (Bai et al. 2022) qui aligne les LLM sur un ensemble explicite et écrit de principes (« constitution ») via deux phases : auto-critique-et-révision supervisée, puis RLAIF ; la technique derrière chaque génération de Claude.
RLAIF
Reinforcement Learning from AI Feedback — la variante du RLHF où un critique IA (et non des annotateurs humains) classe les paires de sorties selon des principes documentés ; élimine le goulot d'étranglement de l'annotation humaine et permet le passage à l'échelle vers des millions d'étiquettes de préférence.
Constitution (in CAI)
L'ensemble écrit, public et auditable de principes qui régissent le comportement d'un LLM sous Constitutional AI ; celle d'Anthropic s'inspire de la DUDH de l'ONU, des CGU d'Apple, de perspectives non occidentales et des principes de sûreté d'Anthropic ; itérée ouvertement d'une génération de Claude à l'autre.
Self-critique step
Le mouvement d'apprentissage constitutionnel supervisé où le modèle est invité à identifier les problèmes de sa propre réponse initiale, puis à la réviser selon les principes constitutionnels ; la paire (prompt, réponse révisée) devient une donnée de SFT.
Partenariat SAP+Anthropic
Le partenariat annoncé par SAP positionnant Claude comme une capacité de raisonnement et agentique primaire à travers Joule et les agents Joule (RH, achats, supply chain), connectée via MCP, Claude lisant le Knowledge Graph de SAP pour le contexte métier — annoncé le 12/05/2026, pas une affirmation GA généralisée à tout cas d'usage.
Limite de portée de la constitution
La portée généraliste d'une constitution publiée (par ex. celle d'Anthropic, s'appuyant sur la DUDH de l'ONU et des principes de sûreté généraux) ne s'étend pas aux normes métier spécifiques à un domaine — principes clean-core, attentes de masquage de données RH, conventions ABAP — qui restent de la responsabilité propre de SAP en matière de gouvernance à l'exécution et de human-in-the-loop, et qu'une réécriture de constitution ne peut pas remplacer.

Sources

  1. Bai et al. — Constitutional AI: Harmlessness from AI Feedback (Anthropic 2022)
  2. Anthropic — Claude's Constitution (public published principles)
  3. Lee et al. — RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback (Google 2023)
  4. Anthropic — Collective Constitutional AI (public deliberation on principles)
  5. SAP Generative AI — official product page
  6. Model Context Protocol — specification 2026-07-28 (the MCP connection referenced in the SAP+Anthropic Claude-Joule partnership)
  7. SAP Help Portal — connect to the MCP server for SAP BTP administration (MCP as the integration path for Claude-based agents)
  8. SAP News Center — SAP + Anthropic, bringing Claude to the SAP Business AI Platform (2026-05-12)
  9. SAP Community — Why SAP needs a Knowledge Graph, grounding enterprise AI reasoning (Claude/Joule context)
  10. SAP News Center — Secure AI agents: how SAP and NVIDIA co-define enterprise-grade agent execution (OpenShell, runtime governance distinct from training-time alignment)
  11. Red Teaming Language Models to Reduce Harms — Ganguli et al., arXiv
  12. Specific versus General Principles for Constitutional AI — Kundu et al., arXiv
  13. Constitutional Classifiers: Defending against universal jailbreaks — Anthropic Research
  14. Self-critiquing models for assisting human evaluators — Saunders et al., arXiv
  15. Deliberative Alignment: Reasoning Enables Safer Language Models — OpenAI, arXiv
  16. Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations — Meta, arXiv

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →