Architecture Transformer pour les praticiens SAP
À jour au 2026-10-06
Qu'est-ce que Architecture Transformer pour les praticiens SAP ?
Le Transformer remplace la récurrence par l'auto-attention pour que chaque token puisse porter attention à tous les autres en parallèle — la raison pour laquelle la fenêtre de contexte de Joule coûte cher et pourquoi le RAG bat généralement le fine-tuning.
De quoi il s'agit
Ce qu'est réellement le Transformer, et pourquoi tout consultant senior en analytics SAP a besoin d'un modèle mental opérationnel de son fonctionnement, tient en un seul fait : c'est l'architecture neuronale qui sous-tend chaque grand modèle de langage de la pile IA de SAP — Joule, les modèles hébergés sur SAP AI Core, le BTP Generative AI Hub, et tout modèle tiers que SAP achemine via son hub de modèles de fondation. Il n'est pas nécessaire de redériver les mathématiques depuis zéro, mais il faut comprendre ce que cette architecture rend possible, ce qu'elle rend coûteux, et où elle se brise — car ces trois éléments déterminent des décisions bien réelles sur le dimensionnement de Joule, la conception des prompts et le tri des hallucinations.
Pourquoi c'est important
- L'auto-attention (Q/K/V, softmax(QKᵀ/√d)) permet à tout token d'informer n'importe quel autre quelle que soit la distance, contrairement aux RNN qui perdent les dépendances au-delà d'environ 512 tokens.
- La connaissance factuelle vit dans la sous-couche feed-forward, pas dans les poids d'attention — une distinction clé pour arbitrer entre fine-tuning et RAG.
- La fenêtre de 128K tokens de Joule signifie que chaque token consomme linéairement la mémoire de cache KV, et les faits placés au milieu du prompt sont moins bien pris en compte au-delà de 32K tokens (effet « lost in the middle »).
Points clés
- Auto-attention : le score Q·K détermine avec quelle intensité chaque token porte son attention sur tous les autres ; la sortie est une somme pondérée des vecteurs V. Multi-têtes = h mécanismes d'attention parallèles.
- La sous-couche feed-forward stocke les connaissances factuelles ; les têtes d'attention se spécialisent dans les types de relations syntaxiques et sémantiques.
- L'encodage positionnel RoPE (LLaMA/Mistral) préserve les informations de position relative sur de grands contextes mieux que les méthodes sinusoïdales absolues.
- Fenêtre de contexte = tokens max en une passe ; les modèles Joule sur BTP Generative AI Hub supportent 128K tokens ; la mémoire du cache KV évolue linéairement.
- Effet 'perdu au milieu' : les faits au centre d'un prompt > 32K tokens sont moins bien attendus — placer les faits clés aux frontières du prompt.
- L'attention multi-têtes (ex. h=96 pour GPT-4-class) permet de capturer différents types de relations simultanément.
Termes employés sur cette page
- Self-attention
- Mécanisme où chaque token calcule une représentation pondérée de tous les autres tokens à l'aide des projections Query, Key, Value ; score = softmax(QKᵀ/√d_k).
- Multi-head attention
- h têtes de self-attention en parallèle, chacune se spécialisant dans un type de relation différent ; les sorties sont concaténées puis projetées linéairement.
- RoPE
- Rotary Position Embedding — encode la position relative des tokens en appliquant des matrices de rotation à Q et K, généralisant mieux aux longs contextes que les méthodes absolues.
- Context window
- Nombre maximal de tokens sur lesquels le modèle porte son attention en une passe avant ; détermine la longueur maximale de document traitable en un seul appel Joule.
- Feed-forward network (FFN)
- La sous-couche MLP à deux couches, appliquée par token après l'attention dans chaque bloc transformer ; empiriquement le principal réservoir de connaissance factuelle/paramétrique d'un modèle, ce qui explique pourquoi le RAG (récupérer les faits au moment de la requête) surpasse généralement le fine-tuning (réécrire les poids du FFN) pour injecter des faits d'entreprise qui changent vite.
- KV cache
- Les tenseurs de projection Key et Value mis en cache pour chaque token précédent d'une génération ; la contrainte réelle de mémoire GPU derrière le coût et les limites de concurrence d'un déploiement auto-hébergé — croît linéairement avec la longueur de contexte maintenue ouverte.
- Lost in the middle
- La dégradation documentée de la fiabilité de l'attention pour les faits placés au milieu d'un long prompt (au-delà d'environ 32K tokens) par rapport aux faits placés tout au début ou tout à la fin — un problème d'ordonnancement de la récupération, pas un bug à corriger dans le modèle.
- Document grounding
- Le mécanisme du service d'orchestration de SAP (dans le generative AI hub) qui récupère et injecte uniquement les passages pertinents pour une requête avant l'appel au LLM, plutôt que de dépendre de la fenêtre de contexte brute du modèle — la réponse de production au lost-in-the-middle et à la croissance du coût du cache KV.
Sources
- Vaswani et al. — Attention Is All You Need (2017)
- SAP BTP Generative AI Hub documentation
- Su et al. — RoFormer: Enhanced Transformer with Rotary Position Embedding (2021)
- Liu et al. — Lost in the Middle: How Language Models Use Long Contexts (2023)
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- SAP Help Portal — Generative AI Hub overview, SAP AI Core (2026)
- Anthropic — Claude context windows documentation (2026)
- Jiang et al. — Mistral 7B technical report, arXiv:2310.06825 (2023)
- SAP Help Portal — Prompt Registry (2026)
- Ainslie et al. — GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints (2023)
- Shazeer — Fast Transformer Decoding: One Write-Head is All You Need (2019)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.