Architecture Transformer
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Architecture Transformer ?
Chaque LLM en production en 2026 exécute le même motif à deux sous-couches — auto-attention mise à l'échelle par 1/√d_h puis un réseau feed-forward en expansion 4d — avec pré-norme et SwiGLU/RMSNorm comme standards modernes qui ont rendu entraînables les modèles de plus de 100 couches.
De quoi il s'agit
Le Transformer est l'architecture de réseau de neurones qui a rendu possible l'IA générative moderne. Introduite par Vaswani et sept coauteurs chez Google en 2017 dans l'article « Attention Is All You Need », elle a remplacé le traitement récurrent des RNN et LSTM par un mécanisme appelé auto-attention, qui permet à chaque token d'une séquence de regarder simultanément tous les autres tokens. Ce choix architectural unique explique pourquoi tous les modèles de langage de pointe déployés en production aujourd'hui — GPT-4, Claude, Gemini, Llama — reposent sur une variante du Transformer, et pourquoi le Transformer compte autant pour un responsable analytics SAP que le stockage colonne de HANA comptait il y a dix ans : c'est le substrat sur lequel tout le reste repose.
Pourquoi c'est important
- Le facteur d'échelle 1/√d_h est ce qui maintient les gradients softmax bien conditionnés — la raison mathématique pour laquelle les piles d'attention profondes n'explosent pas.
- Pré-norme vs post-norme est un choix réellement structurant : la pré-norme élimine la disparition des gradients et supprime le besoin de préchauffage du taux d'apprentissage en profondeur.
- SwiGLU bat ReLU d'environ 1 point de perplexité à calcul égal — un choix d'architecture modeste mais réel et chiffré, utilisé par Llama 3.
Points clés
- Transformer = embedding + L × (MHSA + FFN) + résiduel + norme ; pas de récurrence, entièrement parallèle.
- Auto-attention : Attention(Q,K,V) = softmax(QKᵀ/√d_h)V — la mise à l'échelle par √d_h est essentielle pour la stabilité du gradient.
- Multi-tête : H têtes d'attention parallèles de dimension d_h = d/H chacune ; sorties concaténées puis projetées.
- Sous-couche FFN s'étend à 4d puis reprojecte ; les modèles modernes utilisent SwiGLU au lieu de ReLU.
- La pré-norme (LayerNorm avant la sous-couche) est universelle dans les modèles de production ; la post-norme était l'original de 2017.
- Le masque causal fixe les logits du triangle supérieur à -∞, permettant la génération autorégressive avec un parallélisme d'entraînement complet.
- FLOPs ≈ 2NT par passage avant ; Llama 3.3 70B sur 4 096 tokens ≈ 573 GFLOPs.
- FlashAttention élimine le goulot d'étranglement mémoire O(n²) en subdivisant l'attention en SRAM — prérequis pour les contextes 128K+.
Termes employés sur cette page
- Auto-attention
- Mécanisme où chaque token s'occupe de chaque autre token dans la séquence — projections Q, K, V à partir de la même entrée.
- Attention multi-tête (MHSA)
- Exécution de H têtes d'attention parallèles sur des sous-espaces de dimension d/H, puis concaténation des résultats.
- Connexion résiduelle
- Ajout de l'entrée de la sous-couche à sa sortie : h + Sublayer(h) — prévient la disparition du gradient dans les piles profondes.
- Pré-norme
- Application de LayerNorm avant la sous-couche plutôt qu'après ; universelle dans les modèles modernes pour la stabilité d'entraînement.
- Masque causal
- Masque -∞ triangulaire supérieur sur les logits d'attention garantissant que le token i ne peut pas s'occuper de j > i — rend le modèle autorégressif.
- FFN (réseau feed-forward)
- MLP à deux couches par position avec une dimension intermédiaire de 4d ; la majorité des paramètres Transformer s'y trouve.
- SwiGLU
- Activation à unité linéaire à porte : FFN(x) = (xW₁ ⊙ sigmoid(xW_g))W₂ — utilisée dans Llama 3 pour ~1 point de perplexité d'amélioration sur ReLU.
- FlashAttention
- Noyau d'attention conscient des E/S (Dao et al. 2022) qui subdivise le calcul en SRAM pour éviter la matérialisation mémoire O(n²).
Sources
- Vaswani et al. — Attention Is All You Need (2017)
- Touvron et al. — Llama 3 model card (Meta AI, 2024)
- Dao et al. — FlashAttention-2 (arxiv:2307.08691)
- Hoffmann et al. — Chinchilla scaling laws (arxiv:2203.15556)
- Shazeer — GLU Variants Improve Transformer (arxiv:2002.05202)
- Wang et al. — Pre-norm stabilisation (arxiv:2002.04745)
- NVIDIA H100 Tensor Core GPU datasheet
- SAP Joule — technical architecture overview
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.