Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Data Flows & Transformations

Data Flows & Transformations — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Data Flows & Transformations?

Seit Replication Flows die Standard-Datenaufnahme übernommen haben, sind Data Flows auf drei legitime Aufgaben geschrumpft – Python-Anreicherung, nicht föderierbare quellübergreifende Joins und aufwendige Voraggregation.

Was Data Flows sind, und wo sie im Datasphere-Werkzeugkasten stehen

Data Flows sind Datasphere's visuelle, graphbasierte Transformationspipelines: eine Arbeitsfläche, auf der ein Modellierer Source-Nodes, Join-Nodes, Aggregations-Nodes, optionale eingebettete Python-Skript-Nodes und eine Zieltabelle auf einen gerichteten azyklischen Graphen zieht und den Flow dann aktiviert, sodass er eine Ergebnismenge in eine lokale Datasphere-Tabelle materialisiert. Sie existieren neben zwei weiteren Wegen, Daten in Datasphere zu bewegen und zu formen — Replication Flows, die die unkomplizierte Copy-and-Cast-Aufnahme von einer Quelle in ein Ziel übernehmen, und SQL- oder grafische Views, die Daten live innerhalb der mengenbasierten Engine von HANA umformen, ohne irgendetwas zu persistieren. Data Flows sind bewusst das schmalste der drei Werkzeuge: Seitdem Replication Flows den Standardmechanismus der Datenaufnahme übernommen haben, verdient sich ein Data Flow seine Komplexität nur, wenn die Aufgabe wirklich etwas erfordert, das die beiden anderen nicht leisten können.

Die Anatomie eines Flows

Ein Data Flow hat fünf konzeptionelle Stufen. Source-Nodes bringen lokale Datasphere-Tabellen, föderierte Remote Tables oder hochgeladene Dateien wie CSV oder Parquet ein. Join-Nodes kombinieren Quellen — Inner, Left, Right, Full oder Cross — innerhalb des Flows statt in einer nachgelagerten View. Transform-Nodes wenden Projektionen, Filter, berechnete Spalten, Fensterfunktionen oder ein eingebettetes Python-Skript an, das in einer sandboxed, pandas-kompatiblen Umgebung läuft. Aggregations-Nodes gruppieren Zeilen und berechnen Kennzahlen. Ein Target-Node schreibt das materialisierte Ergebnis bei Aktivierung in eine lokale Datasphere-Tabelle, die auf Abruf oder nach Zeitplan ausgelöst werden kann.

Warum es zählt

  • Einen Data Flow zu verwenden, wo ein Replication Flow oder eine SQL-View ausreichen würde, erzeugt Materialisierungs-Overhead und Wartungsaufwand ohne Nutzen.
  • Python-Nodes laufen sandboxed ohne Internetzugang nach außen und mit einer kuratierten Bibliotheks-Whitelist — planen Sie die Anreicherung um diese Einschränkung herum, nicht um eine vollständige Python-Umgebung.
  • Der CU-Verbrauch pro Flow ist im Tenant Monitor sichtbar — aufwendige Python-Transformation ist eine reale, nachverfolgbare Kostenposition, kein Selbstläufer.

Kernpunkte

  • Fünfstufige Anatomie: Source · Join · Transform · Aggregate · Target.
  • Drei legitime Anwendungsfälle: Python-Anreicherung · quellübergreifender Join · aufwendiges materialisiertes Aggregat.
  • Replication Flow ist die Voreinstellung für die Datenaufnahme (Begleitfiche C005); Data Flow ist die Nische.
  • Python-Nodes 5–10× langsamer als SQL; sandboxed (kein Internetzugang, kuratierte Bibliotheken).
  • Idempotenz: zuerst TRUNCATE des Ziels oder UPSERT-Semantik.
  • Zeitplan + Monitoring + Alerting sind Pflicht; stiller Fehlschlag ist der Fallstrick Nr. 1.
  • CU-Verbrauch: 1–3 CU Basiskosten + Skalierung nach Zeilenvolumen.
  • Joule-unterstütztes Authoring: Preview Q3 2026, GA H1 2027.
  • Data Flows & Transformations ist erst dann beherrscht, wenn es eine konkret benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Werkzeug demonstrieren.

Begriffe auf dieser Seite

Data Flow
Datasphere-Transformationspipeline — visueller DAG aus Source-, Join-, Transform-, Aggregate- und Target-Nodes.
Python node
Sandboxed Python-3.x-Transformationsschritt (pandas, numpy, scikit-learn-light). Kein Internetzugang nach außen.
DAG (Directed Acyclic Graph)
Pipeline-Struktur, in der Nodes ohne Zyklen vorwärts fließen. Jeder Data Flow ist ein DAG.
Idempotency
Eigenschaft, bei der ein erneuter Lauf des Flows identische Ergebnisse liefert. Erfordert TRUNCATE des Ziels oder UPSERT-Semantik.
Activation
Auslöser, der den Flow ausführt. Auf Abruf oder geplant (cron-artig).
Replication Flow vs Data Flow
Replication Flow = Standard-Datenaufnahme (Kopie). Data Flow = Nischen-Transformation (Python · quellübergreifend · aufwendiges Aggregat).
Joule-assisted authoring
Data-Flow-Entwurf per natürlicher Sprache. Preview Q3 2026, GA-Ziel H1 2027.
Tenant Monitor
BDC-Dashboard, das den CU-Verbrauch pro Flow, die Lauf-Historie und Fehler-Alerts anzeigt.

Quellen

  1. SAP Datasphere — Data Flows docs
  2. TechEd 2025 — Joule-assisted authoring preview
  3. DSAG Investitionsreport 2026
  4. Eursap Data Flow vs Replication Flow patterns
  5. SAP Note — Python sandbox library list
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP Datasphere — Help Portal
  9. SAP Datasphere — official product page
  10. SAP Analytics Cloud — Help Portal
  11. SAP Analytics Cloud — official product page
  12. SAP BW/4HANA — Help Portal
  13. SAP S/4HANA — Help Portal
  14. SAP News Center
  15. SAP Community
  16. SAP — industries overview
  17. Gartner — research & analyst site
  18. BARC — BI & Analytics research
  19. TDWI — data & analytics research
  20. DSAG — German-speaking SAP user group
  21. ASUG — Americas' SAP User Group
  22. Databricks — official site
  23. Databricks-in-BDC integration architecture
  24. EU AI Act — Regulation (EU) 2024/1689, Art. 14 (Human Oversight)
  25. SAP Business Data Cloud - Create a custom Data Product based on a replication Flow — SAP Community (Data and Analytics Blog Posts)
  26. SAP Datasphere & Python : One click to export data of multiple views in Excel/CSV — SAP Community (Technology Blog Posts by Members)
  27. Optimizing Data Movement in SAP Datasphere: Replication Flow or Remote Table Replication? — SAP Community (Technology Blog Posts by SAP)
  28. SAP Datasphere Automation : Creating Database user in SAP Datasphere using Datasphere CLI & Python — SAP Community (Technology Blog Posts by Members)
  29. Difference between Replication flow vs Remote Table replication flow in Datasphere — SAP Community (Technology Blog Posts by Members)
  30. Implementing Data Flows in SAP Datasphere: Concepts and Examples — SAP Community (Technology Blog Posts by Members)
  31. SAP Datasphere Replication Flow Logs: Monitoring & Insights — SAP Community (Technology Blog Posts by Members)
  32. SAP Datasphere CLI & Python Automation : ADD 1000+ Users in Datasphere space in few seconds — SAP Community (Technology Blog Posts by Members)
  33. Designing a Lightweight Sales Forecasting Prototype in SAP Datasphere with ChatGPT and Python — SAP Community (Technology Blog Posts by Members)
  34. Integrating Open SQL Schema Tables with SAP Datasphere Space using Dataflow — SAP Community (Technology Blog Posts by Members)
  35. SAP Datasphere CLI & Python: Exporting Modeling Objects to CSV Files for Each Artifact — SAP Community (Technology Blog Posts by Members)
  36. SAP Datasphere - Data flow scripts and generic OData - Unpacking nested values — SAP Community (Technology Blog Posts by Members)
  37. Loop control using SQLScript view, Data Flow script operator & Open SQL procedure in SAP Datasphere — SAP Community (Technology Blog Posts by Members)
  38. Beginner's guide to Data Flows in SAP Datasphere: A step by step approach — SAP Community (Technology Blog Posts by Members)
  39. Steps to Create a Replication Flow in SAP Datasphere for an Existing CDS View in S/4HANA — SAP Community (Technology Blog Posts by SAP)
  40. Replication Flows Blog Series Part 8 – Confluent as a Replication Source — SAP Community (Technology Blog Posts by SAP)
  41. CDS view with Change Data Capture(CDC) for Replication Flow – Part 1 — SAP Community (Technology Blog Posts by Members)
  42. SAP Datasphere - Replication Flow (Delta Functionality) — SAP Community (Technology Blog Posts by Members)
  43. Replication Flow Blog Series Part 7 – Performance — SAP Community (Technology Blog Posts by SAP)
  44. SAP Data Sphere - Replication Flow — SAP Community (Technology Blog Posts by Members)
  45. Exporting Tables from Datasphere to Hana Datalake File System using Replication Flow — SAP Community (Technology Blog Posts by Members)
  46. Understanding Replication Flow Results in Azure (ADLS Gen2) — SAP Community (Technology Blog Posts by Members)
  47. Connect SAP Sales Cloud V2 to SAP Datasphere — SAP Community (Technology Blog Posts by Members)
  48. Set up connection between SAP C4C (Sales Cloud) and SAP Datasphere — SAP Community (Technology Blog Posts by Members)
  49. datasphere exception - 2112401: Hostname 'www.googleapis.com;location' contains invalid characters. — SAP Community (Technology Blog Posts by SAP)

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →