Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production

Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production ?

L'attention a remplacé récurrence et convolution en calculant toutes les interactions token-à-token en une seule passe parallèle — mais ce même design est en O(n²) en longueur de séquence, exactement pourquoi chaque variante moderne (FlashAttention, GQA, sliding window) existe pour la relâcher.

De quoi il s'agit

L'attention est le mécanisme qui permet à chaque token d'une séquence de décider, en un seul calcul parallèle, quels autres tokens comptent pour lui et dans quelle mesure. Elle a remplacé la récurrence et la convolution comme opération dominante de modélisation de séquences après l'article fondateur de 2017 « Attention Is All You Need », et tout modèle grand public qu'un consultant citera — GPT, Claude, Gemini, Llama, Mistral — est un empilement de couches d'attention enveloppées dans des blocs à propagation avant. La comprendre n'est pas une curiosité académique pour un praticien de l'analytique SAP ; c'est le concept qui explique pourquoi le contexte long coûte cher, pourquoi le dimensionnement GPU d'un déploiement auto-hébergé est difficile, et pourquoi la facture par token d'une API se comporte comme elle le fait.

Pourquoi c'est important

  • La mise à l'échelle par √dₖ dans softmax(QKᵀ/√dₖ) existe précisément pour empêcher les produits scalaires de saturer le softmax en haute dimension.
  • Le masquage causal dans les décodeurs annule l'attention sur les tokens futurs — la raison mécanique pour laquelle la génération autorégressive fonctionne un token à la fois.
  • Le coût O(n²·d) est le moteur direct de la facture par token d'un déploiement Joule — ajuster la longueur de contexte ou déboguer la latence revient à ajuster le coût d'attention.

Points clés

  • Formule du produit scalaire mis à l'échelle — softmax(Q·Kᵀ / √dₖ)·V — trois projections par token, une somme pondérée par softmax.
  • La mise à l'échelle par √dₖ évite la saturation du softmax en haute dimension ; sans elle, les gradients s'évanouissent sur les grands modèles.
  • Coût en O(n²·d) en calcul et mémoire — quadratique en la longueur n de séquence, linéaire en la dimension d des têtes.
  • Le masque causal dans les décodeurs annule l'attention sur les tokens futurs, imposant une génération gauche-à-droite.
  • Toutes les optimisations LLM depuis 2017 (FlashAttention, GQA, MQA, fenêtre glissante, sparse) attaquent le mur O(n²).

Termes employés sur cette page

Query / Key / Value (Q, K, V)
Trois projections linéaires de l'embedding de chaque token d'entrée. Q pose la question (« que cherche-je ? »), K annonce la réponse (« que contiens-je ? »), V porte la charge utile qui est mélangée dans la sortie.
Softmax
La fonction de normalisation qui transforme les scores bruts de produit scalaire en une distribution de probabilité sur les tokens. Sature (les gradients s'annulent) lorsque les entrées sont trop grandes — la raison du facteur d'échelle √dₖ.
Causal mask
Un masque triangulaire appliqué avant le softmax dans les modèles decoder-only afin que chaque position n'attende qu'à elle-même et aux positions antérieures ; impose une génération autorégressive de gauche à droite.
Head dimension (dₖ)
La taille des vecteurs Q/K/V de chaque tête d'attention. Valeurs typiques 64 ou 128 ; dimension d'embedding totale du modèle = num_heads × dₖ.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
Control plane
La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. Vaswani et al. — Attention Is All You Need (NeurIPS 2017)
  2. Stanford CS25 — Transformers United (lecture notes 2024-2026)
  3. AI inference just plays by different rules — The Register, 2026-05-04
  4. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  5. SAP News Center — SAP Unveils the Autonomous Enterprise
  6. SAP News Center — The Future of the Enterprise Is Autonomous
  7. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  8. SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →