Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Constitutional AI und RLAIF — wie Anthropic/Claude den Human-in-the-Loop entfernten

Constitutional AI und RLAIF — wie Anthropic/Claude den Human-in-the-Loop entfernten — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Constitutional AI und RLAIF — wie Anthropic/Claude den Human-in-the-Loop entfernten?

Constitutional AI ersetzt die menschlichen Labeler von RLHF durch einen KI-Kritiker, der anhand einer veröffentlichten, schriftlich fixierten Konstitution bewertet — und löst damit sowohl den Labeling-Engpass als auch die Intransparenz ungeschriebener menschlicher Präferenzen.

Constitutional AI, das 2022 von Anthropic eingeführt und in jeder nachfolgenden Claude-Generation weiterentwickelt wurde, adressiert zwei konkrete Schwächen von RLHF: den Engpass beim menschlichen Labeling und die Intransparenz von Präferenzen, die nur in den Köpfen der Labeler existieren, statt irgendwo schriftlich festgehalten zu sein. Es löst beides, indem es den Maßstab explizit macht — eine schriftliche „Konstitution“, ein Satz von Prinzipien, nach denen das Modell trainiert wird zu handeln — und indem es menschliche Vergleichs-Rater durch einen KI-Kritiker ersetzt, eine Technik, die als Reinforcement Learning from AI Feedback oder RLAIF bekannt ist.

Wie die zweiphasige Pipeline funktioniert

Phase eins ist supervised constitutional learning. Dem vortrainierten Modell werden schädliche oder grenzwertige Prompts gezeigt, es erzeugt eine erste Antwort und wird dann gebeten, diese Antwort anhand der Prinzipien der Konstitution zu kritisieren und entsprechend umzuschreiben — zu identifizieren, was an dieser Antwort schädlich, täuschend oder unfair ist, und sie dann so umzuschreiben, dass das Problem beseitigt wird, während sie so hilfreich wie möglich bleibt. Die daraus entstehenden Paare aus Prompt und überarbeiteter Antwort werden zu einem SFT-Datensatz und erzeugen ein Modell, das bereits durch die Konstitution geprägt ist, bevor überhaupt Reinforcement Learning beginnt.

Warum es zählt

  • Zweiphasige Pipeline: Das Modell kritisiert und überarbeitet zunächst seine eigenen schädlichen Antworten anhand expliziter Prinzipien, dann bewertet ein KI-Kritiker die Ausgaben für RLAIF anstelle menschlicher Rater.
  • Die Konstitution ist öffentlich und auditierbar — sie schöpft aus der UN-Menschenrechtserklärung, Apples Nutzungsbedingungen und Anthropics eigenen Sicherheitsprinzipien — ein Transparenzsprung gegenüber den impliziten Präferenzen der RLHF-Labeler.
  • Es adressiert direkt den Labeling-Engpass von RLHF: Zehntausende Vergleiche brauchen Monate, um in Frontier-Modell-Qualität gesammelt zu werden.

Kernpunkte

  • Zweiphasige Pipeline — Phase 1 supervised constitutional learning (Modell kritisiert und überarbeitet sich selbst anhand von Prinzipien); Phase 2 RLAIF (KI-Kritiker bewertet Paare, Preference-Modell wird trainiert, PPO optimiert die Policy).
  • Konstitution — schriftliche, öffentliche, auditierbare Prinzipien (UN-Menschenrechtserklärung, Apple-Nutzungsbedingungen, nicht-westliche Perspektiven, Anthropic-Sicherheit); das Explizite ersetzt die impliziten Präferenzen der Labeler.
  • Skaliert über RLHF hinaus — der KI-Kritiker labelt Millionen von Beispielen zu den Kosten von API-Aufrufen und beseitigt den monatelangen Engpass menschlichen Labelings.
  • Risiken — Konstitutions-Drift (verzerrte Prinzipien werden im großen Maßstab verstärkt), geerbte Fehlkalibrierung des KI-Kritikers; abgemildert durch eine veröffentlichte, iterierte Konstitution.
  • Verbreitung — Anthropic Claude (seit 2022); Selbstkritik-Schritte bei Meta Llama 3; OpenAI Deliberative Alignment für o1; mittlerweile eine Mainstream-Technik.
  • Constitutional AI + RLAIF — How Anthropic / Claude Removed the Human-in-the-Loop ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Constitutional AI (CAI)
Anthropics 2022 vorgestellte Alignment-Technik (Bai et al.), die LLMs an einem expliziten, schriftlichen Satz von Prinzipien (der „Konstitution“) ausrichtet, in zwei Phasen: supervised Selbstkritik-und-Überarbeitung, dann RLAIF; die Technik hinter jeder Claude-Generation.
RLAIF
Reinforcement Learning from AI Feedback — die RLHF-Variante, bei der ein KI-Kritiker (keine menschlichen Labeler) Ausgabepaare nach dokumentierten Prinzipien bewertet; beseitigt den Engpass menschlichen Labelings und ermöglicht Skalierung auf Millionen von Präferenz-Labels.
Konstitution (in CAI)
Der schriftliche, öffentliche, auditierbare Satz von Prinzipien, der das Verhalten eines LLM unter Constitutional AI regelt; Anthropics schöpft aus der UN-Menschenrechtserklärung, Apples Nutzungsbedingungen, nicht-westlichen Perspektiven und Anthropics Sicherheitsprinzipien; wird offen über die Claude-Generationen hinweg iteriert.
Selbstkritik-Schritt
Der Schritt des supervised constitutional learning, bei dem das Modell aufgefordert wird, Probleme in seiner eigenen ersten Antwort zu identifizieren und sie gemäß den konstitutionellen Prinzipien zu überarbeiten; das Paar (Prompt, überarbeitete Antwort) wird zu SFT-Daten.
Decision owner
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantic contract
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control plane
Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidence grade
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Bai et al. — Constitutional AI: Harmlessness from AI Feedback (Anthropic 2022)
  2. Anthropic — Claude's Constitution (public published principles)
  3. Lee et al. — RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback (Google 2023)
  4. Anthropic — Collective Constitutional AI (public deliberation on principles)
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →