Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Architecture Transformer pour les praticiens SAP

Architecture Transformer pour les praticiens SAP — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Architecture Transformer pour les praticiens SAP ?

Le Transformer remplace la récurrence par l'auto-attention pour que chaque token puisse porter attention à tous les autres en parallèle — la raison pour laquelle la fenêtre de contexte de Joule coûte cher et pourquoi le RAG bat généralement le fine-tuning.

Ce qu'est réellement le Transformer, et pourquoi tout consultant senior en analytics SAP a besoin d'un modèle mental opérationnel de son fonctionnement, tient en un seul fait : c'est l'architecture neuronale qui sous-tend chaque grand modèle de langage de la pile IA de SAP — Joule, les modèles hébergés sur SAP AI Core, le BTP Generative AI Hub, et tout modèle tiers que SAP achemine via son hub de modèles de fondation. Il n'est pas nécessaire de redériver les mathématiques depuis zéro, mais il faut comprendre ce que cette architecture rend possible, ce qu'elle rend coûteux, et où elle se brise — car ces trois éléments déterminent des décisions bien réelles sur le dimensionnement de Joule, la conception des prompts et le tri des hallucinations.

Le problème qu'elle résout

Pourquoi c'est important

  • L'auto-attention (Q/K/V, softmax(QKᵀ/√d)) permet à tout token d'informer n'importe quel autre quelle que soit la distance, contrairement aux RNN qui perdent les dépendances au-delà d'environ 512 tokens.
  • La connaissance factuelle vit dans la sous-couche feed-forward, pas dans les poids d'attention — une distinction clé pour arbitrer entre fine-tuning et RAG.
  • La fenêtre de 128K tokens de Joule signifie que chaque token consomme linéairement la mémoire de cache KV, et les faits placés au milieu du prompt sont moins bien pris en compte au-delà de 32K tokens (effet « lost in the middle »).

Points clés

  • Auto-attention : le score Q·K détermine avec quelle intensité chaque token porte son attention sur tous les autres ; la sortie est une somme pondérée des vecteurs V. Multi-têtes = h mécanismes d'attention parallèles.
  • La sous-couche feed-forward stocke les connaissances factuelles ; les têtes d'attention se spécialisent dans les types de relations syntaxiques et sémantiques.
  • L'encodage positionnel RoPE (LLaMA/Mistral) préserve les informations de position relative sur de grands contextes mieux que les méthodes sinusoïdales absolues.
  • Fenêtre de contexte = tokens max en une passe ; les modèles Joule sur BTP Generative AI Hub supportent 128K tokens ; la mémoire du cache KV évolue linéairement.
  • Effet 'perdu au milieu' : les faits au centre d'un prompt > 32K tokens sont moins bien attendus — placer les faits clés aux frontières du prompt.
  • L'attention multi-têtes (ex. h=96 pour GPT-4-class) permet de capturer différents types de relations simultanément.

Termes employés sur cette page

Self-attention
Mécanisme où chaque token calcule une représentation pondérée de tous les autres tokens à l'aide des projections Query, Key, Value ; score = softmax(QKᵀ/√d_k).
Multi-head attention
h têtes de self-attention en parallèle, chacune se spécialisant dans un type de relation différent ; les sorties sont concaténées puis projetées linéairement.
RoPE
Rotary Position Embedding — encode la position relative des tokens en appliquant des matrices de rotation à Q et K, généralisant mieux aux longs contextes que les méthodes absolues.
Context window
Nombre maximal de tokens sur lesquels le modèle porte son attention en une passe avant ; détermine la longueur maximale de document traitable en un seul appel Joule.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, des métriques, des entités et des règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique les politiques, les accès, le lignage, la supervision et l'escalade à l'ensemble du modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. Vaswani et al. — Attention Is All You Need (2017)
  2. SAP BTP Generative AI Hub documentation
  3. Su et al. — RoFormer: Enhanced Transformer with Rotary Position Embedding (2021)
  4. Liu et al. — Lost in the Middle: How Language Models Use Long Contexts (2023)
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →