KI-Red-Teaming und Sicherheitsevaluation — adversariale Prompts, Jailbreaks, Schadensevaluation
Stand 2026-07-23
Was ist KI-Red-Teaming und Sicherheitsevaluation — adversariale Prompts, Jailbreaks, Schadensevaluation?
Red-Teaming ist heute eine Compliance-Anforderung und keine akademische Kür mehr — die Dokumentation nach Art. 9/15 EU AI Act für ein Hochrisikosystem umfasst 200 bis 800 Personentage, und der Mindestumfang für SAP-Deployments erstreckt sich über fünf konkrete Prüfungen.
Worum es geht
AI Red-Teaming ist die strukturierte adversariale Prüfung eines Modells und seines eingesetzten Systems, um unsicheres, verzerrtes, leck-anfälliges oder jailbreak-anfälliges Verhalten AUFZUDECKEN, BEVOR es in Produktion geht. 2026 ist das keine akademische Kuriosität mehr — unter Art. 9 (Risikomanagement) und Art. 15 (Genauigkeit, Robustheit, Cybersicherheit) des EU-AI-Acts müssen Anbieter von Hochrisikosystemen Red-Team-Abdeckung nachweisen; der Dokumentationsaufwand nach Art. 9-49 beträgt gemäß der in der Analytics-Legends-Research-Ledger zitierten Münchner Applied-AI-Studie 200-800 Personentage pro Hochrisikosystem.
Eine Red-Team-Kampagne umfasst vier Arbeitsstränge. Capability Probing deckt auf, wozu das Modell fähig ist — einschließlich Fähigkeiten, die der Anbieter nicht beabsichtigt hat (Exploit-Code schreiben, Biothreat-Anweisungen synthetisieren, CSAM erzeugen). Prompt-Injection- und Jailbreak-Probing testet, ob System-Prompts, Grenzen abgerufenen Kontexts und Tool-Nutzungs-Schutzmaßnahmen durch feindliche Nutzereingaben umgangen werden können. Bias- und Schadensevaluation führt Szenario-Suiten (BBQ, RealToxicityPrompts, HarmBench, DecodingTrust) aus und deckt ungleiche Leistung über demografische Achsen hinweg auf. Missbrauchsevaluation prüft spezifische Hochrisiko-Verwendungen (Wahlmanipulation, Betrug, gezielte Belästigung) und dokumentiert Ablehnungsrate plus verbleibende Leckrate.
Warum es zählt
- Die Kosten sind quantifiziert, nicht abstrakt: Die zitierte Münchner Applied-AI-Studie beziffert den Dokumentationsaufwand nach Art. 9-49 auf 200-800 Personentage pro Hochrisikosystem.
- Die Methodik ist bereits über Labore hinweg kodifiziert (Anthropics RSP, OpenAIs Preparedness Framework, DeepMinds Frontier Safety Framework) und über Standardgremien (NIST AI RMF, MITRE ATLAS, OWASP LLM Top 10) — das ist nicht ad hoc.
- Speziell für SAP nennt der minimale Red-Team-Umfang fünf konkrete Prüfungen: Prompt-Injection über Grenzen abgerufener Inhalte, Joule-Tool-Nutzungs-Datenlecks über Mandanten hinweg, Ablehnungsrate bei HR-/Payroll-Anfragen, Bias bei Kandidaten-Screening-Ausgaben und OWASP-LLM-01-Jailbreak-Resistenz.
Kernpunkte
- Vier Arbeitsstränge — Capability Probing, Prompt-Injection/Jailbreak, Bias- und Schadensevaluation, Missbrauchsevaluation; jeder im Risikoregister nach Art. 9 dokumentiert.
- EU-AI-Act-Pflichten — Art. 9 (Risikomanagement) + Art. 15 (Genauigkeit, Robustheit, Cybersicherheit) verlangen nachgewiesene Red-Team-Abdeckung für Hochrisikosysteme bis 02.08.2026 (Anhang III) / 02.08.2027 (produktintegriert). Gemäß der Analytics-Legends-Research-Ledger.
- Frameworks — Anthropic Responsible Scaling Policy, OpenAI Preparedness, DeepMind Frontier Safety Framework, NIST AI RMF 1.0, MITRE ATLAS, OWASP LLM Top 10.
- Eval-Suiten — BBQ (Bias), RealToxicityPrompts, HarmBench, DecodingTrust, ToxiGen; um domänenspezifische Szenarien ergänzen.
- SAP-spezifischer Umfang — Prompt-Injection über abgerufene Inhalte, mandantengrenzüberschreitende Joule-Tool-Nutzung, Ablehnungsrate bei sensiblen Daten, Bias bei Kandidaten-Screening, OWASP-LLM-01-Jailbreak-Resistenz.
- AI Red-teaming + Safety Evaluation — Adversarial Prompts, Jailbreaks, Harm Eval ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Red-teaming
- Strukturierte adversariale Prüfung eines KI-Systems, um unsicheres, verzerrtes, leck-anfälliges oder jailbreak-anfälliges Verhalten vor dem Produktiveinsatz aufzudecken; kodifiziert unter dem Risikomanagement nach Art. 9 EU-AI-Act für Hochrisikosysteme.
- Jailbreak
- Adversariales Prompt-Muster, das das Sicherheitstraining eines Modells oder seine System-Prompt-Leitplanken umgeht und es zur Erzeugung von Inhalten bringt, die es normalerweise ablehnen würde; katalogisiert unter OWASP LLM-01 und in HarmBench verfolgt.
- Prompt injection
- Angriff, bei dem feindlicher Inhalt, eingebettet in ein Tool-Ergebnis, ein abgerufenes Dokument oder eine Nutzereingabe, die effektiven Anweisungen des Modells umschreibt; OWASP-LLM-Top-10-Risiko Nr. 1 in Produktiv-Deployments.
- Responsible Scaling Policy (RSP)
- Anthropics freiwillige Verpflichtung, AI-Safety-Level-Schwellenwerte (ASL) zu definieren und spezifische Red-Team-Gates, Deployment-Kontrollen und Sicherheitsmaßnahmen zu verlangen, bevor jede Schwelle überschritten wird; nachgeahmt von OpenAIs Preparedness- und DeepMinds Frontier-Safety-Frameworks.
- Decision owner
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantic contract
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Control plane
- Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidence grade
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Anthropic Responsible Scaling Policy
- EU AI Act — Regulation (EU) 2024/1689, Art. 9 (risk management) + Art. 15 (accuracy, robustness, cybersecurity)
- NIST AI Risk Management Framework 1.0
- MITRE ATLAS — Adversarial Threat Landscape for AI Systems
- OWASP Top 10 for Large Language Model Applications
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- EFRAG — CSRD/ESRS standards
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.