Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Données prêtes pour l'IA — qualité, sémantique et lignage

Données prêtes pour l'IA — qualité, sémantique et lignage — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-25

Qu'est-ce que Données prêtes pour l'IA ?

Le vocabulaire propre de SAP pour sa stratégie de données — une « fondation de données de confiance, prête pour l'IA » construite sur des « data products sémantiquement riches et de confiance » — nomme trois ingrédients distincts dont un agent a réellement besoin : une qualité en laquelle il peut avoir confiance, une sémantique avec laquelle il peut raisonner, et un lignage dont il peut être responsable. Chacun a un mécanisme SAP concret derrière lui, et en sauter un produit un agent qui répond avec aisance mais se trompe, pas un agent qui échoue visiblement.

Trois mots cachés dans une phrase marketing

Le cadrage de novembre 2025 par SAP de sa stratégie Business Data Fabric, annoncé aux côtés du partenariat Snowflake, décrit l'objectif comme une « fondation de données de confiance, prête pour l'IA, pour harmoniser les données SAP et non-SAP », construite sur des « data products sémantiquement riches et de confiance » qui ancrent les applications IA « dans la connaissance organisationnelle ». Lue attentivement, cette phrase regroupe trois problèmes d'ingénierie distincts qu'une équipe de delivery doit résoudre séparément, parce qu'aucun n'est résolu en résolvant un autre : une donnée peut être parfaitement propre et rester dénuée de sens pour un LLM sans sémantique ; elle peut être bien étiquetée et rester non fiable si personne ne peut tracer d'où vient un chiffre ; et elle peut être à la fois propre et bien étiquetée aujourd'hui, et silencieusement fausse demain si la qualité n'est jamais surveillée.

Pourquoi c'est important

  • « Prêt pour l'IA » regroupe trois problèmes d'ingénierie distincts — qualité, sémantique, lignage — qui ont des responsables et des outillages différents ; les traiter comme une seule case est la façon dont un client se retrouve avec un agent fluide et faux.
  • Le partage zero-copy (C349) résout le déplacement des données, pas la qualité, la sémantique ni le lignage — un data product partagé plus vite porte toujours les mêmes lacunes qu'avant le partage.
  • Les lacunes de lignage et de sémantique ne produisent aucun défaut visible jusqu'à ce qu'un audit, une demande au titre de l'article 30 du RGPD ou une exigence de traçabilité de l'EU AI Act force la question — moment où l'agent a déjà répondu des milliers de fois.

Points clés

  • La formule propre de SAP, « fondation de données de confiance, prête pour l'IA » sur des « data products sémantiquement riches et de confiance », regroupe trois problèmes distincts : qualité, sémantique, lignage.
  • La qualité pour l'IA a besoin d'une surveillance continue et d'une détection de dérive, pas d'un nettoyage ponctuel — une mauvaise réponse livrée avec aisance est plus difficile à repérer qu'une cellule vide visible.
  • La sémantique vient des métadonnées du Catalog (termes métier, KPI, descriptions) ; la génération de contenu de catalogue assistée par IA est une fonctionnalité premium et nécessite toujours une approbation humaine.
  • Le lignage est capturé automatiquement dans Datasphere pour les objets natifs, mais nécessite des entrées manuelles via la Catalog API pour les sources externes.
  • Le partage zero-copy (BDC Connect vers Databricks, Google, Snowflake) résout le déplacement des données, aucun des trois ingrédients de préparation à l'IA.
  • Noter qualité, sémantique et lignage comme trois lignes séparées dans une évaluation de préparation à l'IA — chacune a un responsable et un chemin de remédiation différents.

Termes employés sur cette page

Données prêtes pour l'IA
Le terme de SAP pour une donnée à la fois fiable (qualité), raisonnable (sémantique) et responsabilisable (lignage) — pas simplement déplaçable.
Détection de dérive
Surveillance statistique qui repère un pipeline de données devenant silencieusement incorrect après avoir été correct.
Catalog API
L'interface Datasphere utilisée pour enregistrer manuellement le lignage des données atteignant la plateforme depuis des sources externes.
Business Data Fabric
Le cadrage stratégique de SAP pour un écosystème de données ouvert et prêt pour l'IA, couvrant SAP et des plateformes tierces.

Sources

  1. SAP News Center — SAP and Snowflake Unleash the Power of Data and Enterprise AI Across the Business Data Fabric (November 2025 — "trusted, AI-ready data foundation", AstraZeneca)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · les pièges courants et leur correctif · l'aide-mémoire · les chiffres à citer.

Ouvrir dans l'application →