AI & Analytics Legends La plateforme de connaissance SAP Analytics
Module d'académie

Flux de données et transformations

Schéma d'architecture du module « Flux de données et transformations » — Analytics Legends Academy, module M006

À jour au 2026-10-04

Data Flow = surface ETL pour ce que Replication Flow ne peut pas (joins cross-sources, ingest fichier, dérivations complexes, SCD Type 2). Règle senior : préférer Replication Flow; Data Flow seulement quand la transformation est nécessaire. Maîtriser 7 opérateurs (Source/Target/Join/Projection/Aggregation/Lookup/Filter + Script). Pousser filtres et projections vers la source. Commentaire d'en-tête sur chaque flow = protection héritage.

Ce que vous apprendrez

  • Travailler un scénario réaliste : SaaS B2B, le reporting de performance des commerciaux nécessite S/4 (commandes) + SuccessFactors (détails commerciaux) + CSV mensuel (objectifs de territoire).
  • Repérer et éviter l'anti-pattern : Data Flow utilisé pour du CDC mono-source — Coût plus élevé, latence plus élevée qu'un Replication Flow.
  • Appliquer la décision clé du module : Data Flow vs Replication Flow — choisir Replication pour CDC d'une source SAP unique ; Data Flow quand 2+ sources ou transformation nécessaire.
  • Mesurer la maîtrise avec le KPI : Temps d'exécution P95 (cible : < fenêtre planifiée ; signal d'alerte : > fenêtre = pushdown manqué ou sous-dimensionnement CU).

Aperçu du module

Data Flow est la surface ETL de Datasphere — pour les transformations que Replication Flow ne sait pas faire (jointures cross-sources, logique métier complexe, ingestion CSV/fichier externe, lookups, dérivations). Règle senior : préférer Replication Flow quand possible; ne dégainer Data Flow que quand la transformation est vraiment nécessaire.

Quand Data Flow gagne.

  • Sources multiples (S/4 + SuccessFactors + Salesforce) joints en un fait.
  • Sources fichier (uploads CSV, Excel mensuels).
  • Dérivations métier complexes (allocation de revenu, conversion devise à taux custom, dérivation fiscale).
  • Dimensions à variation lente (suivi historique Type 2).
  • Pré-agrégation quand la donnée brute est trop volumineuse ou trop sensible à exposer.

Quand Data Flow perd.

  • CDC depuis une source SAP unique → utiliser Replication Flow (moins cher, natif).
  • Latence temps-réel / sous-minute → Data Flow tourne en batch; plancher de latence ~minutes.
  • Transformation qui devrait logiquement vivre dans la couche modèle analytique → la mettre dans une vue, pas un Data Flow.

Prérequis

  • Revoir d'abord les concepts fondamentaux : C008, C006, C005

Acquis

  • Travailler un scénario réaliste : SaaS B2B, le reporting de performance des commerciaux nécessite S/4 (commandes) + SuccessFactors (détails commerciaux) + CSV mensuel (objectifs de territoire).
  • Repérer et éviter l'anti-pattern : Data Flow utilisé pour du CDC mono-source — Coût plus élevé, latence plus élevée qu'un Replication Flow.
  • Appliquer la décision clé du module : Data Flow vs Replication Flow — choisir Replication pour CDC d'une source SAP unique ; Data Flow quand 2+ sources ou transformation nécessaire.
  • Mesurer la maîtrise avec le KPI : Temps d'exécution P95 (cible : < fenêtre planifiée ; signal d'alerte : > fenêtre = pushdown manqué ou sous-dimensionnement CU).

Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.

Ouvrir dans l'application →