Vektordatenbanken im SAP-Kontext
Stand 2026-09-03
Die Entscheidung in Woche eins in diesem Modul: Braucht die Landschaft die native REAL_VECTOR-Engine von HANA Cloud, oder erzwingt der Umfang — realistisch oberhalb von fünf bis zehn Millionen Vektoren — einen externen, ANN-indizierten Speicher wie Pinecone oder Milvus? Unterhalb dieser Schwelle beantwortet die Full-Scan-Kosinus-Ähnlichkeitssuche von HANA Cloud in unter 200 ms und erbt Governance, Backup und Disaster Recovery gratis mit. Der Beratungswert liegt in drei Entscheidungen, die die meisten SAP-Teams beim ersten Versuch falsch treffen: strukturierte Objekte nach semantischer Gruppe statt nach Tabelle zu chunken, das Embedding-Modell auf den tatsächlichen Sprachmix der Metadaten abzustimmen und ein Recall@5/MRR-Bewertungsgerüst aufzubauen, bevor behauptet wird, die Retrieval-Schicht funktioniere. Berater, die diese Entscheidungen mit Zahlen verteidigen können — nicht mit einer Demo —, sind für die RAG- und Joule-Architekturprojekte positioniert, die jeder SAP-Kunde jetzt beginnt.
Was Sie lernen
- Implementieren Sie den nativen REAL_VECTOR-Spaltentyp von HANA Cloud und die SQL-Funktionen zur Kosinus-Ähnlichkeit, um eine semantische Suchschicht über SAP-Metadatenobjekte aufzubauen — InfoProvider-Beschreibungen, Datasphere-Entitätenkataloge und SAC-Modellmetadaten — und bewerten Sie die Retrieval-Performance anhand von Recall@K und MRR gegenüber einem gekennzeichneten Testset.
- Entwerfen Sie eine Chunking-Strategie für strukturierte SAP-Datenobjekte (BW-ADSOs, analytische Datasphere-Views), die semantische Beziehungen zwischen Kennzahlen, Dimensionen und abgeleiteten Berechnungen bewahrt, und implementieren Sie Delta-Re-Embedding-Pipelines, die durch SAP-Change-Data-Capture-Ereignisse ausgelöst werden.
- Entwerfen Sie ein hybrides Dense-plus-Sparse-Retrieval-System in HANA Cloud, das die Vektor-Ähnlichkeitssuche mittels Reciprocal Rank Fusion mit einer BM25-Volltextsuche kombiniert, und bestimmen Sie, wann die Full-Scan-Vector-Engine von HANA Cloud ausreicht und wann eine externe, ANN-indizierte Vektordatenbank gerechtfertigt ist.
- Wenden Sie Auswahlkriterien für mehrsprachige Embedding-Modelle auf SAP-Landschaften mit gemischtsprachigen Metadaten an, implementieren Sie eine DSGVO-konforme Spiegelung der Zugriffskontrolle vom zugrunde liegenden SAP-Berechtigungsmodell auf den Vektor-Retrieval-Korpus, und definieren Sie Richtlinien zum Management der Veraltung für produktive Embedding-Speicher.
Was Vektordatenbanken tatsächlich leisten und warum SAP-Berater sich damit befassen müssen
Eine Vektordatenbank indiziert numerische Repräsentationen von Inhalten — Embeddings — und ermöglicht das schnelle Abrufen von Elementen, deren Embeddings im hochdimensionalen Raum nahe beieinander liegen. Dieser Satz klingt abstrakt. Die Praxis ist konkret: Ein Berater tippt „zeig mir SAP-Kundengeschichten zur Resilienz der Lieferkette" ein, und das System liefert relevante Fallstudien, geordnet nach semantischer Ähnlichkeit, nicht nach Stichwortübereinstimmung. Der Wechsel von der Stichwortsuche zur semantischen Suche klingt nach einer geringfügigen UX-Verbesserung. Tatsächlich handelt es sich um ein architektonisches Grundelement, das eine Kategorie von Anwendungen ermöglicht — RAG, semantische Deduplizierung, Empfehlung, Anomalieerkennung auf unstrukturierten Daten —, die Stichwortdatenbanken nicht in Produktionsqualität unterstützen können.
Voraussetzungen
- Praktische Erfahrung auf mittlerem Niveau in SAP-Analytics-Projekten
- Zuerst die Kernkonzepte wiederholen: C090, C087, C083
Lernergebnisse
- Arbeiten Sie ein realistisches Szenario durch: Ein europäischer Konzern aus der diskreten Fertigung führt Joule über seinen Datasphere-Entitätenkatalog und seine BW/4HANA-InfoProvider ein.
- Erkennen und vermeiden Sie das Anti-Pattern: rein englischsprachiges Embedding-Modell auf mehrsprachigen SAP-Metadaten — deutscher und französischer Text kollabiert lautlos zu degradierten Vektor-Repräsentationen.
- Wenden Sie die Kernentscheidung des Moduls an: native Vector Engine von HANA Cloud vs.
- Verfolgen Sie den Lernfortschritt anhand des KPI: Recall@5 (Ziel: >= 0,75 auf dem gekennzeichneten Testset; Warnsignal: < 0,60 — meist eine Fehlpassung zwischen Chunking oder Embedding-Modell und der tatsächlichen Anfrageverteilung).
Vollständiges Modul für Mitglieder. Das vollständige Modul ergänzt: den Entscheidungsrahmen · das durchgehende Szenario · die KPI-Scorecard · die Anti-Muster · die Codeblöcke · die Wissenskontrolle · die Schemata.