KI-bereite Daten — Qualität, Semantik und Lineage
Stand 2026-09-25
Was ist KI-bereite Daten?
SAPs eigenes Vokabular für seine Datenstrategie – eine „vertrauenswürdige, KI-bereite Datengrundlage“, aufgebaut auf „semantisch reichen, vertrauenswürdigen Datenprodukten“ – benennt drei getrennte Zutaten, die ein Agent tatsächlich braucht: Qualität, der er vertrauen kann, Semantik, mit der er argumentieren kann, und Lineage, für die er zur Rechenschaft gezogen werden kann. Jede hat einen konkreten SAP-Mechanismus dahinter, und eine davon auszulassen erzeugt einen flüssig antwortenden, aber falschen Agenten – keinen, der sichtbar scheitert.
Drei Wörter, versteckt in einem Marketingsatz
SAPs Darstellung seiner Business-Data-Fabric-Strategie vom November 2025, angekündigt zusammen mit der Snowflake-Partnerschaft, beschreibt das Ziel als eine „vertrauenswürdige, KI-bereite Datengrundlage, um SAP- und Nicht-SAP-Daten zu harmonisieren“, aufgebaut auf „semantisch reichen, vertrauenswürdigen Datenprodukten“, die KI-Anwendungen „in organisatorischem Wissen“ erden. Genau gelesen bündelt dieser Satz drei getrennte technische Probleme, die ein Delivery-Team getrennt lösen muss, weil keines durch die Lösung eines anderen gelöst wird: Daten können makellos sauber und trotzdem für ein LLM bedeutungslos sein, ohne Semantik; sie können gut beschriftet und trotzdem nicht vertrauenswürdig sein, wenn niemand nachvollziehen kann, woher eine Zahl stammt; und sie können heute sowohl sauber als auch gut beschriftet sein und morgen still falsch werden, wenn Qualität nie überwacht wird.
Qualität: vertrauenswürdig, nicht nur vorhanden
Ein Datenqualitätsproblem für KI ist nicht dasselbe wie eines für einen Bericht. Ein Dashboard mit einer leeren Zelle ist sichtbar unvollständig; ein LLM, das gebeten wird, dieselbe Tabelle zusammenzufassen, produziert dennoch einen selbstsicheren Satz, weil es nicht weiß, was es nicht weiß. Deshalb neigt Qualität für KI zu kontinuierlicher Überwachung statt einmaliger Bereinigung – Regeln, Kennzahlen und Abhilfe nach Zeitplan angewandt, mit Drift-Erkennung, die den Fall erfasst, in dem eine früher korrekte Pipeline still aufhört, korrekt zu sein. Die Disziplin existiert unabhängig von KI (es ist dieselbe, die einen Finanzbericht prüffähig hält), aber KI erhöht die Kosten, sie auszulassen, weil eine flüssig gelieferte falsche Antwort schwerer zu erkennen ist als eine falsche Zahl in einer Zelle.
Warum es zählt
- „KI-bereit“ bündelt drei getrennte technische Probleme — Qualität, Semantik, Lineage — mit unterschiedlichen Verantwortlichen und unterschiedlichem Werkzeug; sie als ein einziges Kästchen zu behandeln, ist der Weg, wie ein Kunde bei einem flüssigen, falschen Agenten landet.
- Zero-Copy-Freigabe (C349) löst Datenbewegung, nicht Qualität, Semantik oder Lineage — ein schneller freigegebenes Datenprodukt trägt weiterhin dieselben Lücken wie vor der Freigabe.
- Lineage- und Semantiklücken erzeugen keinen sichtbaren Mangel, bis ein Audit, eine DSGVO-Artikel-30-Anfrage oder eine EU-AI-Act-Nachvollziehbarkeitsfrage das Thema erzwingt — zu diesem Zeitpunkt hat der Agent bereits Tausende Male geantwortet.
Kernpunkte
- SAPs eigene Formulierung, „vertrauenswürdige, KI-bereite Datengrundlage“ auf „semantisch reichen, vertrauenswürdigen Datenprodukten“, bündelt drei getrennte Probleme: Qualität, Semantik, Lineage.
- Qualität für KI braucht kontinuierliche Überwachung und Drift-Erkennung, keine einmalige Bereinigung — eine flüssig gelieferte falsche Antwort ist schwerer zu erkennen als ein sichtbarer Nullwert.
- Semantik kommt aus Katalog-Metadaten (Geschäftsbegriffe, KPIs, Beschreibungen); KI-gestützte Katalog-Inhaltsgenerierung ist eine Premium-Funktion und braucht weiterhin menschliche Genehmigung.
- Lineage wird innerhalb von Datasphere für native Objekte automatisch erfasst, braucht aber manuelle Catalog-API-Einträge für externe Quellen.
- Zero-Copy-Freigabe (BDC Connect zu Databricks, Google, Snowflake) löst Datenbewegung, keine der drei KI-Bereitschafts-Zutaten.
- Qualität, Semantik und Lineage als drei getrennte Zeilen in einer KI-Bereitschaftsbewertung bewerten — jede hat einen anderen Verantwortlichen und Abhilfeweg.
Begriffe auf dieser Seite
- KI-bereite Daten
- SAPs Begriff für Daten, die gleichzeitig vertrauenswürdig (Qualität), schlussfolgerbar (Semantik) und rechenschaftspflichtig (Lineage) sind — nicht nur bewegbar.
- Drift-Erkennung
- Statistische Überwachung, die erfasst, wenn eine Datenpipeline still falsch wird, nachdem sie korrekt war.
- Catalog API
- Die Datasphere-Schnittstelle zur manuellen Registrierung von Lineage für Daten, die die Plattform aus externen Quellen erreichen.
- Business Data Fabric
- SAPs strategische Darstellung eines offenen, KI-bereiten Datenökosystems über SAP- und Drittplattformen hinweg.
Quellen
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die zitierfähigen Kennzahlen.