AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Modèles de fondation vision dans les contextes SAP

Modèles de fondation vision dans les contextes SAP — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Modèles de fondation vision dans les contextes SAP ?

Les modèles de fondation vision transforment les données image SAP inexploitables — factures scannées, photos d'atelier, PDF de contrats — en caractéristiques structurées, avec des classifieurs de documents atteignant déjà >96 % de précision sur les formats SAP standards.

De quoi il s'agit

Les modèles de fondation pour la vision sont de grands réseaux de neurones pré-entraînés sur des centaines de millions de paires image-texte, et ils résolvent un problème structurel pour lequel les bases de données relationnelles n'ont jamais été conçues : les données d'entreprise de SAP regorgent d'images — factures scannées, photos de contrôle qualité en atelier, PDF de contrats, photographies de terrain jointes aux ordres de maintenance — qu'aucune requête SQL ne peut indexer directement. Les modèles de vision convertissent ces données visuelles opaques en caractéristiques structurées sur lesquelles un modèle en aval, ou un agent Joule, peut effectivement raisonner.

Pourquoi c'est important

  • Les classifieurs à base de ViT dans SAP DOX extraient les coordonnées de champs avec >96 % de précision, déployés en endpoint managé SAP BTP AI Core.
  • Un ViT affiné déclenché par une notification PM atteint un rappel défauts >92 % à 30 ms par image sur GPU T4 pour le contrôle qualité en atelier.
  • La segmentation d'actifs par SAM réduit le temps d'inspection manuelle d'infrastructures de 40 à 60 % dans les pilotes.

Points clés

  • CLIP, ViT, SAM sont des encodeurs/segmenteurs — pas des modèles génératifs ; ils produisent des embeddings ou des masques.
  • SAP BTP encapsule un DOX à base de ViT pour l'extraction de factures et de bons de commande avec >96 % de précision sur les layouts SAP standards.
  • Contrôle qualité en atelier : ViT fine-tuné sur des images de défauts, relié via OData aux notifications PM de S/4.
  • Budget de fine-tuning : 2 000 à 10 000 images annotées, 4 à 8 heures-GPU sur ViT-B/16.
  • À éviter si le signal visuel est déjà structuré dans les codes QM/PM — le coût d'inférence GPU dépasse le gain marginal.
  • SAP Document AI propose quatre plans (Base, Embedded, Premium — facturé en AI Units — et Free) ; l'interface Workspace et les API OData v4 sont réservées à Embedded/Premium, et SAP met explicitement en garde sur le fait que les résultats d'extraction « peuvent ne pas être entièrement exempts d'erreurs » — garder une étape de revue humaine au-delà d'un seuil de confiance.
  • La sortie d'un modèle de vision qui alimente un agent Joule ou un processus S/4 doit être traitée comme le résultat d'un appel d'outil, soumis à la même discipline de garde-fou que tout autre résultat d'outil — une image mal segmentée ou un type de document mal classé est un fait erroné injecté dans la chaîne de raisonnement, pas une erreur cosmétique.

Termes employés sur cette page

CLIP
Contrastive Language-Image Pretraining — OpenAI 2021. Aligne image et texte dans un espace d'embedding partagé via une perte contrastive ; usage principal : recherche d'images et classification zero-shot.
ViT
Vision Transformer — Google 2020. Découpe une image en patchs de taille fixe, les aplatit en séquences de tokens, et les injecte dans un encodeur transformer standard. État de l'art sur ImageNet avec des données de pré-entraînement suffisantes.
SAM
Segment Anything Model — Meta 2023. Renvoie des masques au niveau du pixel pour des objets arbitraires dans une image, à partir d'un prompt de type point, boîte ou texte. Sa propriété distinctive est la généralisation zero-shot.
DOX
Le nom d'ingénierie encore utilisé en interne pour SAP Document AI (anciennement Document Information Extraction) — le service BTP qui exploite des classifieurs à base de ViT et des modèles sensibles à la mise en page pour extraire des champs structurés de documents métier numérisés.
SAP Document AI
Le nom de produit actuel de SAP pour son service d'extraction documentaire ; propose les plans Base, Embedded et Premium (Premium/Embedded facturés en AI Units) plus un palier Free, l'interface Workspace et les API OData v4 étant réservées à Embedded/Premium.
Zero-shot (vision)
La capacité d'un modèle à traiter une nouvelle catégorie d'objet ou un nouveau layout de document sur lequel il n'a jamais été explicitement entraîné — la propriété distinctive de SAM pour la segmentation, et la raison pour laquelle un seul modèle de base peut être pointé vers une nouvelle tâche d'inspection sans réentraînement complet, généralement avec une précision moindre qu'un modèle fine-tuné.
Bounding box
Les coordonnées pixel rectangulaires qu'un modèle d'extraction documentaire ou de détection d'objet renvoie pour localiser un champ ou un objet dans une image — la sortie structurée qu'un processus SAP en aval (ex. un workflow de rapprochement de factures) consomme réellement, pas l'image brute.
Domain shift (dérive de domaine)
L'écart entre les images génériques à l'échelle d'internet sur lesquelles un modèle de fondation vision a été pré-entraîné et la distribution visuelle spécifique de l'imagerie industrielle, médicale ou propre à un site d'un client — la raison pour laquelle le fine-tuning, et non le seul modèle de base, est généralement requis pour une précision de niveau production.

Sources

  1. SAP Document Information Extraction — SAP Help Portal
  2. OpenAI CLIP paper — Radford et al. 2021
  3. SAM — Meta AI Segment Anything paper 2023
  4. SAP AI Core on BTP — managed ML endpoints
  5. SAP Business AI — official product page
  6. SAP Joule (work companion) — official product page
  7. SAP Generative AI — official product page
  8. Dosovitskiy et al. — An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT), arXiv:2010.11929 (2020)
  9. SAP Help Portal — What is SAP Document AI (2026)
  10. SAP — Document AI service description / plans PDF (2026)
  11. OpenAI — CLIP: Connecting text and images (announcement)
  12. NVIDIA — Tesla T4 GPU specifications (inference hardware reference)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →