Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Vision-Foundation-Modelle im SAP-Kontext

Vision-Foundation-Modelle im SAP-Kontext — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Vision-Foundation-Modelle im SAP-Kontext?

Vision-Foundation-Modelle verwandeln SAPs nicht indexierbare Bilddaten — gescannte Rechnungen, Fotos von der Werkstatt, Vertrags-PDFs — in strukturierte Merkmale; Dokumentenklassifikatoren erreichen bei Standard-SAP-Layouts bereits eine Genauigkeit von über 96 %.

Vision-Foundation-Modelle sind große neuronale Netze, die auf Hunderten Millionen von Bild-Text-Paaren vortrainiert wurden, und sie lösen ein strukturelles Problem, für das relationale Datenbanken nie gebaut wurden: SAPs Unternehmensdaten sind voller Bilder — gescannte Rechnungen, Qualitätsprüfungsfotos vom Shopfloor, Vertrags-PDFs, Field-Service-Fotos an Instandhaltungsaufträgen —, die keine SQL-Abfrage direkt indizieren kann. Vision-Modelle wandeln diese undurchsichtigen visuellen Daten in strukturierte Merkmale um, über die ein nachgelagertes Modell oder ein Joule-Agent tatsächlich schlussfolgern kann.

Die drei Referenzmodelle

Drei Vision-Foundation-Modelle bilden das Rückgrat fast jedes Enterprise-Deployments. CLIP, 2021 von OpenAI veröffentlicht, richtet Bilder und Text über kontrastives Training in einem gemeinsamen Embedding-Raum aus, was es zur natürlichen Wahl für bildbasiertes Retrieval macht. ViT, Googles Vision Transformer aus dem Jahr 2020, behandelt ein Bild als Raster von Patches, die in einen Standard-Transformer-Encoder eingespeist werden, und ist damit das Arbeitspferd für Klassifizierung und Feature-Extraktion. SAM, Metas Segment Anything Model aus dem Jahr 2023, führt Zero-Shot-Segmentierung anhand eines räumlichen Prompts durch — einem Punkt oder einer Box —, ohne für jede neue Objektkategorie neu trainiert werden zu müssen. Keines der drei Modelle ist im Sinne der Bildsynthese generativ; es handelt sich um Encoder und Segmentierer, und diese Unterscheidung ist beim Scoping eines Projekts wichtig, denn ein Kunde, der nach „KI, die unsere Rechnungen liest" fragt, braucht einen Dokumentenklassifikator, keinen Bildgenerator.

Warum es zählt

  • ViT-basierte Klassifikatoren in SAP DOX extrahieren Bounding-Boxes auf Feldebene mit >96 % Genauigkeit, bereitgestellt als gemanagter SAP-BTP-AI-Core-Endpoint.
  • Ein fine-getuntes ViT, angebunden an einen PM-Meldungs-Trigger, erreicht >92 % Defekt-Recall bei 30 ms pro Bild auf einer T4-GPU für die Shopfloor-Qualitätskontrolle.
  • SAM-basiertes Asset-Condition-Scoring senkt die manuelle Infrastruktur-Inspektionszeit in Pilot-Deployments um 40-60 %.

Kernpunkte

  • CLIP, ViT, SAM sind Encoder/Segmentierer — nicht generativ; sie erzeugen Embeddings oder Masken.
  • SAP BTP kapselt ViT-basiertes DOX für die Rechnungs- und Bestellextraktion mit >96 % Genauigkeit bei Standard-SAP-Layouts.
  • Shopfloor-Qualitätskontrolle: ViT, fine-getuned auf Defektbildern, über OData an die S/4-PM-Meldung angebunden.
  • Fine-Tuning-Budget: 2.000-10.000 gelabelte Bilder, 4-8 GPU-Stunden auf ViT-B/16.
  • Vermeiden, wenn das visuelle Signal bereits in QM-/PM-Codes strukturiert vorliegt — die GPU-Inferenzkosten übersteigen den Grenznutzen.
  • Vision-Foundation-Modelle im SAP-Kontext ist erst beherrscht, wenn sie die Entscheidung eines konkret benannten Buyers verändert.
  • Zuerst den semantischen Vertrag und das Kontrollmodell klären, bevor das Tool vorgeführt wird.
  • Aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg nutzen, nicht als Dekoration.
  • Verifizierte Fakten klar von richtungsweisenden Trends und modellierten Annahmen trennen.
  • Vor dem Skalieren Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback festlegen.

Begriffe auf dieser Seite

CLIP
Contrastive Language-Image Pretraining — OpenAI 2021. Richtet Bild und Text über einen kontrastiven Loss in einem gemeinsamen Embedding-Raum aus; primärer Einsatz: Bild-Retrieval und Zero-Shot-Klassifizierung.
ViT
Vision Transformer — Google 2020. Zerlegt ein Bild in Patches fester Größe, flacht sie zu Token-Sequenzen ab und speist sie in einen Standard-Transformer-Encoder ein. State-of-the-Art auf ImageNet bei ausreichenden Vortrainingsdaten.
SAM
Segment Anything Model — Meta 2023. Liefert pixelgenaue Masken für beliebige Objekte in einem Bild anhand eines Punkt-, Box- oder Text-Prompts. Zero-Shot-Generalisierung ist seine bestimmende Eigenschaft.
DOX
SAP Document Information Extraction — BTP-Service, der ViT-basierte Klassifikatoren und layoutbewusste Modelle nutzt, um strukturierte Felder aus gescannten Geschäftsdokumenten zu extrahieren.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das gesamte Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.

Quellen

  1. SAP Document Information Extraction — SAP Help Portal
  2. OpenAI CLIP paper — Radford et al. 2021
  3. SAM — Meta AI Segment Anything paper 2023
  4. SAP AI Core on BTP — managed ML endpoints
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →