Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

KI-Red-Teaming und Sicherheitsevaluation — adversariale Prompts, Jailbreaks, Schadensevaluation

KI-Red-Teaming und Sicherheitsevaluation — adversariale Prompts, Jailbreaks, Schadensevaluation — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist KI-Red-Teaming und Sicherheitsevaluation — adversariale Prompts, Jailbreaks, Schadensevaluation?

Red-Teaming ist heute eine Compliance-Anforderung und keine akademische Kür mehr — die Dokumentation nach Art. 9/15 EU AI Act für ein Hochrisikosystem umfasst 200 bis 800 Personentage, und der Mindestumfang für SAP-Deployments erstreckt sich über fünf konkrete Prüfungen.

Worum es geht

AI Red-Teaming ist die strukturierte adversariale Prüfung eines Modells und seines eingesetzten Systems, um unsicheres, verzerrtes, leck-anfälliges oder jailbreak-anfälliges Verhalten AUFZUDECKEN, BEVOR es in Produktion geht. 2026 ist das keine akademische Kuriosität mehr — unter Art. 9 (Risikomanagement) und Art. 15 (Genauigkeit, Robustheit, Cybersicherheit) des EU-AI-Acts müssen Anbieter von Hochrisikosystemen Red-Team-Abdeckung nachweisen; der Dokumentationsaufwand nach Art. 9-49 beträgt gemäß der in der Analytics-Legends-Research-Ledger zitierten Münchner Applied-AI-Studie 200-800 Personentage pro Hochrisikosystem.

Eine Red-Team-Kampagne umfasst vier Arbeitsstränge. Capability Probing deckt auf, wozu das Modell fähig ist — einschließlich Fähigkeiten, die der Anbieter nicht beabsichtigt hat (Exploit-Code schreiben, Biothreat-Anweisungen synthetisieren, CSAM erzeugen). Prompt-Injection- und Jailbreak-Probing testet, ob System-Prompts, Grenzen abgerufenen Kontexts und Tool-Nutzungs-Schutzmaßnahmen durch feindliche Nutzereingaben umgangen werden können. Bias- und Schadensevaluation führt Szenario-Suiten (BBQ, RealToxicityPrompts, HarmBench, DecodingTrust) aus und deckt ungleiche Leistung über demografische Achsen hinweg auf. Missbrauchsevaluation prüft spezifische Hochrisiko-Verwendungen (Wahlmanipulation, Betrug, gezielte Belästigung) und dokumentiert Ablehnungsrate plus verbleibende Leckrate.

Warum es zählt

  • Die Kosten sind quantifiziert, nicht abstrakt: Die zitierte Münchner Applied-AI-Studie beziffert den Dokumentationsaufwand nach Art. 9-49 auf 200-800 Personentage pro Hochrisikosystem.
  • Die Methodik ist bereits über Labore hinweg kodifiziert (Anthropics RSP, OpenAIs Preparedness Framework, DeepMinds Frontier Safety Framework) und über Standardgremien (NIST AI RMF, MITRE ATLAS, OWASP LLM Top 10) — das ist nicht ad hoc.
  • Speziell für SAP nennt der minimale Red-Team-Umfang fünf konkrete Prüfungen: Prompt-Injection über Grenzen abgerufener Inhalte, Joule-Tool-Nutzungs-Datenlecks über Mandanten hinweg, Ablehnungsrate bei HR-/Payroll-Anfragen, Bias bei Kandidaten-Screening-Ausgaben und OWASP-LLM-01-Jailbreak-Resistenz.

Kernpunkte

  • Vier Arbeitsstränge — Capability Probing, Prompt-Injection/Jailbreak, Bias- und Schadensevaluation, Missbrauchsevaluation; jeder im Risikoregister nach Art. 9 dokumentiert.
  • EU-AI-Act-Pflichten — Art. 9 (Risikomanagement) + Art. 15 (Genauigkeit, Robustheit, Cybersicherheit) verlangen nachgewiesene Red-Team-Abdeckung für Hochrisikosysteme bis 02.08.2026 (Anhang III) / 02.08.2027 (produktintegriert). Gemäß der Analytics-Legends-Research-Ledger.
  • Frameworks — Anthropic Responsible Scaling Policy, OpenAI Preparedness, DeepMind Frontier Safety Framework, NIST AI RMF 1.0, MITRE ATLAS, OWASP LLM Top 10.
  • Eval-Suiten — BBQ (Bias), RealToxicityPrompts, HarmBench, DecodingTrust, ToxiGen; um domänenspezifische Szenarien ergänzen.
  • SAP-spezifischer Umfang — Prompt-Injection über abgerufene Inhalte, mandantengrenzüberschreitende Joule-Tool-Nutzung, Ablehnungsrate bei sensiblen Daten, Bias bei Kandidaten-Screening, OWASP-LLM-01-Jailbreak-Resistenz.
  • AI Red-teaming + Safety Evaluation — Adversarial Prompts, Jailbreaks, Harm Eval ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Red-teaming
Strukturierte adversariale Prüfung eines KI-Systems, um unsicheres, verzerrtes, leck-anfälliges oder jailbreak-anfälliges Verhalten vor dem Produktiveinsatz aufzudecken; kodifiziert unter dem Risikomanagement nach Art. 9 EU-AI-Act für Hochrisikosysteme.
Jailbreak
Adversariales Prompt-Muster, das das Sicherheitstraining eines Modells oder seine System-Prompt-Leitplanken umgeht und es zur Erzeugung von Inhalten bringt, die es normalerweise ablehnen würde; katalogisiert unter OWASP LLM-01 und in HarmBench verfolgt.
Prompt injection
Angriff, bei dem feindlicher Inhalt, eingebettet in ein Tool-Ergebnis, ein abgerufenes Dokument oder eine Nutzereingabe, die effektiven Anweisungen des Modells umschreibt; OWASP-LLM-Top-10-Risiko Nr. 1 in Produktiv-Deployments.
Responsible Scaling Policy (RSP)
Anthropics freiwillige Verpflichtung, AI-Safety-Level-Schwellenwerte (ASL) zu definieren und spezifische Red-Team-Gates, Deployment-Kontrollen und Sicherheitsmaßnahmen zu verlangen, bevor jede Schwelle überschritten wird; nachgeahmt von OpenAIs Preparedness- und DeepMinds Frontier-Safety-Frameworks.
Decision owner
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantic contract
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control plane
Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidence grade
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Anthropic Responsible Scaling Policy
  2. EU AI Act — Regulation (EU) 2024/1689, Art. 9 (risk management) + Art. 15 (accuracy, robustness, cybersecurity)
  3. NIST AI Risk Management Framework 1.0
  4. MITRE ATLAS — Adversarial Threat Landscape for AI Systems
  5. OWASP Top 10 for Large Language Model Applications
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. EFRAG — CSRD/ESRS standards
  19. Gartner — research & analyst site
  20. BARC — BI & Analytics research
  21. TDWI — data & analytics research
  22. DSAG — German-speaking SAP user group
  23. ASUG — Americas' SAP User Group
  24. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →