Architecture Transformer pour les praticiens SAP
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Architecture Transformer pour les praticiens SAP ?
Le Transformer remplace la récurrence par l'auto-attention pour que chaque token puisse porter attention à tous les autres en parallèle — la raison pour laquelle la fenêtre de contexte de Joule coûte cher et pourquoi le RAG bat généralement le fine-tuning.
Ce qu'est réellement le Transformer, et pourquoi tout consultant senior en analytics SAP a besoin d'un modèle mental opérationnel de son fonctionnement, tient en un seul fait : c'est l'architecture neuronale qui sous-tend chaque grand modèle de langage de la pile IA de SAP — Joule, les modèles hébergés sur SAP AI Core, le BTP Generative AI Hub, et tout modèle tiers que SAP achemine via son hub de modèles de fondation. Il n'est pas nécessaire de redériver les mathématiques depuis zéro, mais il faut comprendre ce que cette architecture rend possible, ce qu'elle rend coûteux, et où elle se brise — car ces trois éléments déterminent des décisions bien réelles sur le dimensionnement de Joule, la conception des prompts et le tri des hallucinations.
Le problème qu'elle résout
Pourquoi c'est important
- L'auto-attention (Q/K/V, softmax(QKᵀ/√d)) permet à tout token d'informer n'importe quel autre quelle que soit la distance, contrairement aux RNN qui perdent les dépendances au-delà d'environ 512 tokens.
- La connaissance factuelle vit dans la sous-couche feed-forward, pas dans les poids d'attention — une distinction clé pour arbitrer entre fine-tuning et RAG.
- La fenêtre de 128K tokens de Joule signifie que chaque token consomme linéairement la mémoire de cache KV, et les faits placés au milieu du prompt sont moins bien pris en compte au-delà de 32K tokens (effet « lost in the middle »).
Points clés
- Auto-attention : le score Q·K détermine avec quelle intensité chaque token porte son attention sur tous les autres ; la sortie est une somme pondérée des vecteurs V. Multi-têtes = h mécanismes d'attention parallèles.
- La sous-couche feed-forward stocke les connaissances factuelles ; les têtes d'attention se spécialisent dans les types de relations syntaxiques et sémantiques.
- L'encodage positionnel RoPE (LLaMA/Mistral) préserve les informations de position relative sur de grands contextes mieux que les méthodes sinusoïdales absolues.
- Fenêtre de contexte = tokens max en une passe ; les modèles Joule sur BTP Generative AI Hub supportent 128K tokens ; la mémoire du cache KV évolue linéairement.
- Effet 'perdu au milieu' : les faits au centre d'un prompt > 32K tokens sont moins bien attendus — placer les faits clés aux frontières du prompt.
- L'attention multi-têtes (ex. h=96 pour GPT-4-class) permet de capturer différents types de relations simultanément.
Termes employés sur cette page
- Self-attention
- Mécanisme où chaque token calcule une représentation pondérée de tous les autres tokens à l'aide des projections Query, Key, Value ; score = softmax(QKᵀ/√d_k).
- Multi-head attention
- h têtes de self-attention en parallèle, chacune se spécialisant dans un type de relation différent ; les sorties sont concaténées puis projetées linéairement.
- RoPE
- Rotary Position Embedding — encode la position relative des tokens en appliquant des matrices de rotation à Q et K, généralisant mieux aux longs contextes que les méthodes absolues.
- Context window
- Nombre maximal de tokens sur lesquels le modèle porte son attention en une passe avant ; détermine la longueur maximale de document traitable en un seul appel Joule.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, des métriques, des entités et des règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique les politiques, les accès, le lignage, la supervision et l'escalade à l'ensemble du modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Vaswani et al. — Attention Is All You Need (2017)
- SAP BTP Generative AI Hub documentation
- Su et al. — RoFormer: Enhanced Transformer with Rotary Position Embedding (2021)
- Liu et al. — Lost in the Middle: How Language Models Use Long Contexts (2023)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.