Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Architecture Transformer

Architecture Transformer — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Architecture Transformer ?

Chaque LLM en production en 2026 exécute le même motif à deux sous-couches — auto-attention mise à l'échelle par 1/√d_h puis un réseau feed-forward en expansion 4d — avec pré-norme et SwiGLU/RMSNorm comme standards modernes qui ont rendu entraînables les modèles de plus de 100 couches.

De quoi il s'agit

Le Transformer est l'architecture de réseau de neurones qui a rendu possible l'IA générative moderne. Introduite par Vaswani et sept coauteurs chez Google en 2017 dans l'article « Attention Is All You Need », elle a remplacé le traitement récurrent des RNN et LSTM par un mécanisme appelé auto-attention, qui permet à chaque token d'une séquence de regarder simultanément tous les autres tokens. Ce choix architectural unique explique pourquoi tous les modèles de langage de pointe déployés en production aujourd'hui — GPT-4, Claude, Gemini, Llama — reposent sur une variante du Transformer, et pourquoi le Transformer compte autant pour un responsable analytics SAP que le stockage colonne de HANA comptait il y a dix ans : c'est le substrat sur lequel tout le reste repose.

Pourquoi c'est important

  • Le facteur d'échelle 1/√d_h est ce qui maintient les gradients softmax bien conditionnés — la raison mathématique pour laquelle les piles d'attention profondes n'explosent pas.
  • Pré-norme vs post-norme est un choix réellement structurant : la pré-norme élimine la disparition des gradients et supprime le besoin de préchauffage du taux d'apprentissage en profondeur.
  • SwiGLU bat ReLU d'environ 1 point de perplexité à calcul égal — un choix d'architecture modeste mais réel et chiffré, utilisé par Llama 3.

Points clés

  • Transformer = embedding + L × (MHSA + FFN) + résiduel + norme ; pas de récurrence, entièrement parallèle.
  • Auto-attention : Attention(Q,K,V) = softmax(QKᵀ/√d_h)V — la mise à l'échelle par √d_h est essentielle pour la stabilité du gradient.
  • Multi-tête : H têtes d'attention parallèles de dimension d_h = d/H chacune ; sorties concaténées puis projetées.
  • Sous-couche FFN s'étend à 4d puis reprojecte ; les modèles modernes utilisent SwiGLU au lieu de ReLU.
  • La pré-norme (LayerNorm avant la sous-couche) est universelle dans les modèles de production ; la post-norme était l'original de 2017.
  • Le masque causal fixe les logits du triangle supérieur à -∞, permettant la génération autorégressive avec un parallélisme d'entraînement complet.
  • FLOPs ≈ 2NT par passage avant ; Llama 3.3 70B sur 4 096 tokens ≈ 573 GFLOPs.
  • FlashAttention élimine le goulot d'étranglement mémoire O(n²) en subdivisant l'attention en SRAM — prérequis pour les contextes 128K+.

Termes employés sur cette page

Auto-attention
Mécanisme où chaque token s'occupe de chaque autre token dans la séquence — projections Q, K, V à partir de la même entrée.
Attention multi-tête (MHSA)
Exécution de H têtes d'attention parallèles sur des sous-espaces de dimension d/H, puis concaténation des résultats.
Connexion résiduelle
Ajout de l'entrée de la sous-couche à sa sortie : h + Sublayer(h) — prévient la disparition du gradient dans les piles profondes.
Pré-norme
Application de LayerNorm avant la sous-couche plutôt qu'après ; universelle dans les modèles modernes pour la stabilité d'entraînement.
Masque causal
Masque -∞ triangulaire supérieur sur les logits d'attention garantissant que le token i ne peut pas s'occuper de j > i — rend le modèle autorégressif.
FFN (réseau feed-forward)
MLP à deux couches par position avec une dimension intermédiaire de 4d ; la majorité des paramètres Transformer s'y trouve.
SwiGLU
Activation à unité linéaire à porte : FFN(x) = (xW₁ ⊙ sigmoid(xW_g))W₂ — utilisée dans Llama 3 pour ~1 point de perplexité d'amélioration sur ReLU.
FlashAttention
Noyau d'attention conscient des E/S (Dao et al. 2022) qui subdivise le calcul en SRAM pour éviter la matérialisation mémoire O(n²).

Sources

  1. Vaswani et al. — Attention Is All You Need (2017)
  2. Touvron et al. — Llama 3 model card (Meta AI, 2024)
  3. Dao et al. — FlashAttention-2 (arxiv:2307.08691)
  4. Hoffmann et al. — Chinchilla scaling laws (arxiv:2203.15556)
  5. Shazeer — GLU Variants Improve Transformer (arxiv:2002.05202)
  6. Wang et al. — Pre-norm stabilisation (arxiv:2002.04745)
  7. NVIDIA H100 Tensor Core GPU datasheet
  8. SAP Joule — technical architecture overview
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →