Constitutional AI und RLAIF — wie Anthropic/Claude den Human-in-the-Loop entfernten
Stand 2026-07-24T14:00:00Z
Was ist Constitutional AI und RLAIF — wie Anthropic/Claude den Human-in-the-Loop entfernten?
Constitutional AI ersetzt die menschlichen Labeler von RLHF durch einen KI-Kritiker, der anhand einer veröffentlichten, schriftlich fixierten Konstitution bewertet — und löst damit sowohl den Labeling-Engpass als auch die Intransparenz ungeschriebener menschlicher Präferenzen.
Constitutional AI, das 2022 von Anthropic eingeführt und in jeder nachfolgenden Claude-Generation weiterentwickelt wurde, adressiert zwei konkrete Schwächen von RLHF: den Engpass beim menschlichen Labeling und die Intransparenz von Präferenzen, die nur in den Köpfen der Labeler existieren, statt irgendwo schriftlich festgehalten zu sein. Es löst beides, indem es den Maßstab explizit macht — eine schriftliche „Konstitution“, ein Satz von Prinzipien, nach denen das Modell trainiert wird zu handeln — und indem es menschliche Vergleichs-Rater durch einen KI-Kritiker ersetzt, eine Technik, die als Reinforcement Learning from AI Feedback oder RLAIF bekannt ist.
Wie die zweiphasige Pipeline funktioniert
Phase eins ist supervised constitutional learning. Dem vortrainierten Modell werden schädliche oder grenzwertige Prompts gezeigt, es erzeugt eine erste Antwort und wird dann gebeten, diese Antwort anhand der Prinzipien der Konstitution zu kritisieren und entsprechend umzuschreiben — zu identifizieren, was an dieser Antwort schädlich, täuschend oder unfair ist, und sie dann so umzuschreiben, dass das Problem beseitigt wird, während sie so hilfreich wie möglich bleibt. Die daraus entstehenden Paare aus Prompt und überarbeiteter Antwort werden zu einem SFT-Datensatz und erzeugen ein Modell, das bereits durch die Konstitution geprägt ist, bevor überhaupt Reinforcement Learning beginnt.
Warum es zählt
- Zweiphasige Pipeline: Das Modell kritisiert und überarbeitet zunächst seine eigenen schädlichen Antworten anhand expliziter Prinzipien, dann bewertet ein KI-Kritiker die Ausgaben für RLAIF anstelle menschlicher Rater.
- Die Konstitution ist öffentlich und auditierbar — sie schöpft aus der UN-Menschenrechtserklärung, Apples Nutzungsbedingungen und Anthropics eigenen Sicherheitsprinzipien — ein Transparenzsprung gegenüber den impliziten Präferenzen der RLHF-Labeler.
- Es adressiert direkt den Labeling-Engpass von RLHF: Zehntausende Vergleiche brauchen Monate, um in Frontier-Modell-Qualität gesammelt zu werden.
Kernpunkte
- Zweiphasige Pipeline — Phase 1 supervised constitutional learning (Modell kritisiert und überarbeitet sich selbst anhand von Prinzipien); Phase 2 RLAIF (KI-Kritiker bewertet Paare, Preference-Modell wird trainiert, PPO optimiert die Policy).
- Konstitution — schriftliche, öffentliche, auditierbare Prinzipien (UN-Menschenrechtserklärung, Apple-Nutzungsbedingungen, nicht-westliche Perspektiven, Anthropic-Sicherheit); das Explizite ersetzt die impliziten Präferenzen der Labeler.
- Skaliert über RLHF hinaus — der KI-Kritiker labelt Millionen von Beispielen zu den Kosten von API-Aufrufen und beseitigt den monatelangen Engpass menschlichen Labelings.
- Risiken — Konstitutions-Drift (verzerrte Prinzipien werden im großen Maßstab verstärkt), geerbte Fehlkalibrierung des KI-Kritikers; abgemildert durch eine veröffentlichte, iterierte Konstitution.
- Verbreitung — Anthropic Claude (seit 2022); Selbstkritik-Schritte bei Meta Llama 3; OpenAI Deliberative Alignment für o1; mittlerweile eine Mainstream-Technik.
- Constitutional AI + RLAIF — How Anthropic / Claude Removed the Human-in-the-Loop ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Constitutional AI (CAI)
- Anthropics 2022 vorgestellte Alignment-Technik (Bai et al.), die LLMs an einem expliziten, schriftlichen Satz von Prinzipien (der „Konstitution“) ausrichtet, in zwei Phasen: supervised Selbstkritik-und-Überarbeitung, dann RLAIF; die Technik hinter jeder Claude-Generation.
- RLAIF
- Reinforcement Learning from AI Feedback — die RLHF-Variante, bei der ein KI-Kritiker (keine menschlichen Labeler) Ausgabepaare nach dokumentierten Prinzipien bewertet; beseitigt den Engpass menschlichen Labelings und ermöglicht Skalierung auf Millionen von Präferenz-Labels.
- Konstitution (in CAI)
- Der schriftliche, öffentliche, auditierbare Satz von Prinzipien, der das Verhalten eines LLM unter Constitutional AI regelt; Anthropics schöpft aus der UN-Menschenrechtserklärung, Apples Nutzungsbedingungen, nicht-westlichen Perspektiven und Anthropics Sicherheitsprinzipien; wird offen über die Claude-Generationen hinweg iteriert.
- Selbstkritik-Schritt
- Der Schritt des supervised constitutional learning, bei dem das Modell aufgefordert wird, Probleme in seiner eigenen ersten Antwort zu identifizieren und sie gemäß den konstitutionellen Prinzipien zu überarbeiten; das Paar (Prompt, überarbeitete Antwort) wird zu SFT-Daten.
- Decision owner
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantic contract
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Control plane
- Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidence grade
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Bai et al. — Constitutional AI: Harmlessness from AI Feedback (Anthropic 2022)
- Anthropic — Claude's Constitution (public published principles)
- Lee et al. — RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback (Google 2023)
- Anthropic — Collective Constitutional AI (public deliberation on principles)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.