Grounding & RAG (Retrieval-Augmented Generation)
Stand 2026-07-24T14:00:00Z
Was ist Grounding & RAG (Retrieval-Augmented Generation)?
Ohne RAG-Grounding halluzinieren LLMs selbstbewusst auf Daten, die bis zu 18 Monate veraltet sein können – mit RAG lässt sich jede Joule-Antwort auf eine Zitatkette zurückführen, die die Prüferfrage „woher stammt das?" in 30 Sekunden beantwortet.
Was es ist
Retrieval-Augmented Generation, kurz RAG, ist das architektonische Muster, das die Antworten eines großen Sprachmodells in abgerufenen Unternehmensdaten verankert, statt sich allein auf das zu verlassen, was das Modell zufällig beim Training memoriert hat. Der Ablauf lässt sich einfach beschreiben, auch wenn das darunterliegende Engineering es nicht ist: Ein Nutzer stellt eine Frage, eine Retrieval-Schicht ruft relevante Dokumente oder Datensätze aus einem Korpus ab, dieser abgerufene Kontext wird neben den Prompt des Nutzers gestellt, das Modell erzeugt eine Antwort, die durch das gerade Gezeigte eingeschränkt wird, und Zitate verknüpfen die Antwort zurück mit den Quelldatensätzen, aus denen sie geschöpft wurde. Für SAP-Analytics ist RAG das Fundament unter Joules Grounding-Fähigkeit und der eigentliche Unterschied gegenüber „ChatGPT auf Ihre Dateien angesetzt"-Alternativen, die die Governance-Schicht auslassen.
Die fünf Komponenten
Indexierung baut den Korpus auf: Quelldokumente und -datensätze werden mittels semantischer Embeddings in einen Vektorspeicher eingebettet. Retrieval findet zur Abfragezeit statt — der Prompt des Nutzers wird eingebettet, und die Top-K ähnlichsten Chunks werden abgerufen, typischerweise irgendwo zwischen drei und zehn. Re-Ranking ist eine optionale zweite Stufe, die ein Cross-Encoder-Modell nutzt, um diese Top-K-Liste zu verfeinern, bevor überhaupt etwas das Sprachmodell erreicht. Bei der Generierung erhält das Modell den Prompt, den abgerufenen Kontext und die Systemanweisungen und erzeugt seine Antwort. Die Zitation schließt den Kreis, indem sie Verweise zurück auf die konkreten Dokumente oder Datensätze anhängt, aus denen die Antwort tatsächlich geschöpft hat.
Warum es zählt
- Strukturiertes Retrieval gegen Datasphere Analytic Models, Dokument-Retrieval und Knowledge-Graph-Traversierung sind drei eigenständige RAG-Quellen, die die meisten produktiven Joule-Einführungen kombinieren — kein einzelner Mechanismus.
- Die Zitationskette ist es, die eine LLM-Antwort zu einem prüfbaren Artefakt macht — ohne sie sind eine plausibel klingende und eine korrekte Antwort für den Fachanwender nicht zu unterscheiden.
- Re-Ranking (eine optionale Cross-Encoder-Stufe) verfeinert die abgerufenen Top-K-Chunks — wird es bei kritischen Abfragen übersprungen, riskiert man, das LLM mit knapp danebenliegendem Kontext zu versorgen.
Kernpunkte
- Fünf Komponenten: Indexierung · Retrieval · Re-Ranking · Generierung · Zitation.
- Drei SAP-Quellen: Datasphere AM · Dokumente · Knowledge Graph.
- Chunk-Größe 500-1500 Tokens; Top-K 5-10 mit Re-Ranking.
- Zitate sind verpflichtend — fehlen sie, verfehlt das den Zweck des Grounding.
- EWR-ansässiges LLM für EU-Personendaten + SCC + TIA gemäß Schrems II.
- Kosten pro Abfrage 0,01-0,05 $; Tenant typischerweise ~7.500 $/Jahr.
- Re-Indexierung bei Release des Quellsystems + nächtlichem Delta.
- Fusion von Knowledge Graph und RAG für 12-24 Monate angekündigt.
- Grounding & RAG (Retrieval-Augmented Generation) ist erst beherrscht, wenn es eine benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
Begriffe auf dieser Seite
- RAG (Retrieval-Augmented Generation)
- LLM-Muster, das Antworten in abgerufenen Unternehmensdaten verankert, statt sich auf Trainingsdaten-Erinnerung zu verlassen.
- Vektorspeicher
- Datenbank semantischer Embeddings, die den Korpus indexiert. Ermöglicht ähnlichkeitsbasiertes Retrieval.
- Embedding
- Numerische Vektordarstellung von Text (oder anderen Inhalten), die die semantische Bedeutung erfasst.
- Top-K-Retrieval
- Abrufen der K ähnlichsten Chunks zur Abfragezeit. Sweet Spot 5-10 mit Re-Ranking.
- Cross-Encoder-Re-Ranking
- Optionale zweite Bewertungsstufe, die die Top-K verfeinert. Hoher ROI für die Qualität der Top-3.
- Zitationskette
- Prüfbare Verweiskette von der Antwort zurück zu den herangezogenen Quelldokumenten/-datensätzen.
- Hybrides Retrieval
- Kombination von BM25 (lexikalisch) und dichten Vektoren (semantisch) für breiteren Recall.
- Agentic-RAG
- Mehrstufiges Retrieval mit LLM-gesteuertem Reasoning zwischen den Abrufen. Preview-Muster.
Quellen
- Anthropic — RAG best practices
- GDPR Art. 28 + Schrems-II + LLM provider sub-processing
- TechEd 2025 — RAG architecture deep-dive
- DSAG AI Workgroup outputs
- OpenAI text-embedding-3 reference
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- EU AI Act — Reg. (EU) 2024/1689 (EUR-Lex)
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.