Data Flows & Transformations
Stand 2026-07-24T14:00:00Z
Was ist Data Flows & Transformations?
Seit Replication Flows die Standard-Datenaufnahme übernommen haben, sind Data Flows auf drei legitime Aufgaben geschrumpft – Python-Anreicherung, nicht föderierbare quellübergreifende Joins und aufwendige Voraggregation.
Was Data Flows sind, und wo sie im Datasphere-Werkzeugkasten stehen
Data Flows sind Datasphere's visuelle, graphbasierte Transformationspipelines: eine Arbeitsfläche, auf der ein Modellierer Source-Nodes, Join-Nodes, Aggregations-Nodes, optionale eingebettete Python-Skript-Nodes und eine Zieltabelle auf einen gerichteten azyklischen Graphen zieht und den Flow dann aktiviert, sodass er eine Ergebnismenge in eine lokale Datasphere-Tabelle materialisiert. Sie existieren neben zwei weiteren Wegen, Daten in Datasphere zu bewegen und zu formen — Replication Flows, die die unkomplizierte Copy-and-Cast-Aufnahme von einer Quelle in ein Ziel übernehmen, und SQL- oder grafische Views, die Daten live innerhalb der mengenbasierten Engine von HANA umformen, ohne irgendetwas zu persistieren. Data Flows sind bewusst das schmalste der drei Werkzeuge: Seitdem Replication Flows den Standardmechanismus der Datenaufnahme übernommen haben, verdient sich ein Data Flow seine Komplexität nur, wenn die Aufgabe wirklich etwas erfordert, das die beiden anderen nicht leisten können.
Die Anatomie eines Flows
Ein Data Flow hat fünf konzeptionelle Stufen. Source-Nodes bringen lokale Datasphere-Tabellen, föderierte Remote Tables oder hochgeladene Dateien wie CSV oder Parquet ein. Join-Nodes kombinieren Quellen — Inner, Left, Right, Full oder Cross — innerhalb des Flows statt in einer nachgelagerten View. Transform-Nodes wenden Projektionen, Filter, berechnete Spalten, Fensterfunktionen oder ein eingebettetes Python-Skript an, das in einer sandboxed, pandas-kompatiblen Umgebung läuft. Aggregations-Nodes gruppieren Zeilen und berechnen Kennzahlen. Ein Target-Node schreibt das materialisierte Ergebnis bei Aktivierung in eine lokale Datasphere-Tabelle, die auf Abruf oder nach Zeitplan ausgelöst werden kann.
Warum es zählt
- Einen Data Flow zu verwenden, wo ein Replication Flow oder eine SQL-View ausreichen würde, erzeugt Materialisierungs-Overhead und Wartungsaufwand ohne Nutzen.
- Python-Nodes laufen sandboxed ohne Internetzugang nach außen und mit einer kuratierten Bibliotheks-Whitelist — planen Sie die Anreicherung um diese Einschränkung herum, nicht um eine vollständige Python-Umgebung.
- Der CU-Verbrauch pro Flow ist im Tenant Monitor sichtbar — aufwendige Python-Transformation ist eine reale, nachverfolgbare Kostenposition, kein Selbstläufer.
Kernpunkte
- Fünfstufige Anatomie: Source · Join · Transform · Aggregate · Target.
- Drei legitime Anwendungsfälle: Python-Anreicherung · quellübergreifender Join · aufwendiges materialisiertes Aggregat.
- Replication Flow ist die Voreinstellung für die Datenaufnahme (Begleitfiche C005); Data Flow ist die Nische.
- Python-Nodes 5–10× langsamer als SQL; sandboxed (kein Internetzugang, kuratierte Bibliotheken).
- Idempotenz: zuerst TRUNCATE des Ziels oder UPSERT-Semantik.
- Zeitplan + Monitoring + Alerting sind Pflicht; stiller Fehlschlag ist der Fallstrick Nr. 1.
- CU-Verbrauch: 1–3 CU Basiskosten + Skalierung nach Zeilenvolumen.
- Joule-unterstütztes Authoring: Preview Q3 2026, GA H1 2027.
- Data Flows & Transformations ist erst dann beherrscht, wenn es eine konkret benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Werkzeug demonstrieren.
Begriffe auf dieser Seite
- Data Flow
- Datasphere-Transformationspipeline — visueller DAG aus Source-, Join-, Transform-, Aggregate- und Target-Nodes.
- Python node
- Sandboxed Python-3.x-Transformationsschritt (pandas, numpy, scikit-learn-light). Kein Internetzugang nach außen.
- DAG (Directed Acyclic Graph)
- Pipeline-Struktur, in der Nodes ohne Zyklen vorwärts fließen. Jeder Data Flow ist ein DAG.
- Idempotency
- Eigenschaft, bei der ein erneuter Lauf des Flows identische Ergebnisse liefert. Erfordert TRUNCATE des Ziels oder UPSERT-Semantik.
- Activation
- Auslöser, der den Flow ausführt. Auf Abruf oder geplant (cron-artig).
- Replication Flow vs Data Flow
- Replication Flow = Standard-Datenaufnahme (Kopie). Data Flow = Nischen-Transformation (Python · quellübergreifend · aufwendiges Aggregat).
- Joule-assisted authoring
- Data-Flow-Entwurf per natürlicher Sprache. Preview Q3 2026, GA-Ziel H1 2027.
- Tenant Monitor
- BDC-Dashboard, das den CU-Verbrauch pro Flow, die Lauf-Historie und Fehler-Alerts anzeigt.
Quellen
- SAP Datasphere — Data Flows docs
- TechEd 2025 — Joule-assisted authoring preview
- DSAG Investitionsreport 2026
- Eursap Data Flow vs Replication Flow patterns
- SAP Note — Python sandbox library list
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- Databricks-in-BDC integration architecture
- EU AI Act — Regulation (EU) 2024/1689, Art. 14 (Human Oversight)
- SAP Business Data Cloud - Create a custom Data Product based on a replication Flow — SAP Community (Data and Analytics Blog Posts)
- SAP Datasphere & Python : One click to export data of multiple views in Excel/CSV — SAP Community (Technology Blog Posts by Members)
- Optimizing Data Movement in SAP Datasphere: Replication Flow or Remote Table Replication? — SAP Community (Technology Blog Posts by SAP)
- SAP Datasphere Automation : Creating Database user in SAP Datasphere using Datasphere CLI & Python — SAP Community (Technology Blog Posts by Members)
- Difference between Replication flow vs Remote Table replication flow in Datasphere — SAP Community (Technology Blog Posts by Members)
- Implementing Data Flows in SAP Datasphere: Concepts and Examples — SAP Community (Technology Blog Posts by Members)
- SAP Datasphere Replication Flow Logs: Monitoring & Insights — SAP Community (Technology Blog Posts by Members)
- SAP Datasphere CLI & Python Automation : ADD 1000+ Users in Datasphere space in few seconds — SAP Community (Technology Blog Posts by Members)
- Designing a Lightweight Sales Forecasting Prototype in SAP Datasphere with ChatGPT and Python — SAP Community (Technology Blog Posts by Members)
- Integrating Open SQL Schema Tables with SAP Datasphere Space using Dataflow — SAP Community (Technology Blog Posts by Members)
- SAP Datasphere CLI & Python: Exporting Modeling Objects to CSV Files for Each Artifact — SAP Community (Technology Blog Posts by Members)
- SAP Datasphere - Data flow scripts and generic OData - Unpacking nested values — SAP Community (Technology Blog Posts by Members)
- Loop control using SQLScript view, Data Flow script operator & Open SQL procedure in SAP Datasphere — SAP Community (Technology Blog Posts by Members)
- Beginner's guide to Data Flows in SAP Datasphere: A step by step approach — SAP Community (Technology Blog Posts by Members)
- Steps to Create a Replication Flow in SAP Datasphere for an Existing CDS View in S/4HANA — SAP Community (Technology Blog Posts by SAP)
- Replication Flows Blog Series Part 8 – Confluent as a Replication Source — SAP Community (Technology Blog Posts by SAP)
- CDS view with Change Data Capture(CDC) for Replication Flow – Part 1 — SAP Community (Technology Blog Posts by Members)
- SAP Datasphere - Replication Flow (Delta Functionality) — SAP Community (Technology Blog Posts by Members)
- Replication Flow Blog Series Part 7 – Performance — SAP Community (Technology Blog Posts by SAP)
- SAP Data Sphere - Replication Flow — SAP Community (Technology Blog Posts by Members)
- Exporting Tables from Datasphere to Hana Datalake File System using Replication Flow — SAP Community (Technology Blog Posts by Members)
- Understanding Replication Flow Results in Azure (ADLS Gen2) — SAP Community (Technology Blog Posts by Members)
- Connect SAP Sales Cloud V2 to SAP Datasphere — SAP Community (Technology Blog Posts by Members)
- Set up connection between SAP C4C (Sales Cloud) and SAP Datasphere — SAP Community (Technology Blog Posts by Members)
- datasphere exception - 2112401: Hostname 'www.googleapis.com;location' contains invalid characters. — SAP Community (Technology Blog Posts by SAP)
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.