Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production ?
L'attention a remplacé récurrence et convolution en calculant toutes les interactions token-à-token en une seule passe parallèle — mais ce même design est en O(n²) en longueur de séquence, exactement pourquoi chaque variante moderne (FlashAttention, GQA, sliding window) existe pour la relâcher.
De quoi il s'agit
L'attention est le mécanisme qui permet à chaque token d'une séquence de décider, en un seul calcul parallèle, quels autres tokens comptent pour lui et dans quelle mesure. Elle a remplacé la récurrence et la convolution comme opération dominante de modélisation de séquences après l'article fondateur de 2017 « Attention Is All You Need », et tout modèle grand public qu'un consultant citera — GPT, Claude, Gemini, Llama, Mistral — est un empilement de couches d'attention enveloppées dans des blocs à propagation avant. La comprendre n'est pas une curiosité académique pour un praticien de l'analytique SAP ; c'est le concept qui explique pourquoi le contexte long coûte cher, pourquoi le dimensionnement GPU d'un déploiement auto-hébergé est difficile, et pourquoi la facture par token d'une API se comporte comme elle le fait.
Pourquoi c'est important
- La mise à l'échelle par √dₖ dans softmax(QKᵀ/√dₖ) existe précisément pour empêcher les produits scalaires de saturer le softmax en haute dimension.
- Le masquage causal dans les décodeurs annule l'attention sur les tokens futurs — la raison mécanique pour laquelle la génération autorégressive fonctionne un token à la fois.
- Le coût O(n²·d) est le moteur direct de la facture par token d'un déploiement Joule — ajuster la longueur de contexte ou déboguer la latence revient à ajuster le coût d'attention.
Points clés
- Formule du produit scalaire mis à l'échelle — softmax(Q·Kᵀ / √dₖ)·V — trois projections par token, une somme pondérée par softmax.
- La mise à l'échelle par √dₖ évite la saturation du softmax en haute dimension ; sans elle, les gradients s'évanouissent sur les grands modèles.
- Coût en O(n²·d) en calcul et mémoire — quadratique en la longueur n de séquence, linéaire en la dimension d des têtes.
- Le masque causal dans les décodeurs annule l'attention sur les tokens futurs, imposant une génération gauche-à-droite.
- Toutes les optimisations LLM depuis 2017 (FlashAttention, GQA, MQA, fenêtre glissante, sparse) attaquent le mur O(n²).
Termes employés sur cette page
- Query / Key / Value (Q, K, V)
- Trois projections linéaires de l'embedding de chaque token d'entrée. Q pose la question (« que cherche-je ? »), K annonce la réponse (« que contiens-je ? »), V porte la charge utile qui est mélangée dans la sortie.
- Softmax
- La fonction de normalisation qui transforme les scores bruts de produit scalaire en une distribution de probabilité sur les tokens. Sature (les gradients s'annulent) lorsque les entrées sont trop grandes — la raison du facteur d'échelle √dₖ.
- Causal mask
- Un masque triangulaire appliqué avant le softmax dans les modèles decoder-only afin que chaque position n'attende qu'à elle-même et aux positions antérieures ; impose une génération autorégressive de gauche à droite.
- Head dimension (dₖ)
- La taille des vecteurs Q/K/V de chaque tête d'attention. Valeurs typiques 64 ou 128 ; dimension d'embedding totale du modèle = num_heads × dₖ.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
- Control plane
- La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Vaswani et al. — Attention Is All You Need (NeurIPS 2017)
- Stanford CS25 — Transformers United (lecture notes 2024-2026)
- AI inference just plays by different rules — The Register, 2026-05-04
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.