AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production

Mécanisme d'Attention — Du Produit Scalaire Mis à l'Échelle à la Production — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Mécanisme d'Attention ?

L'attention a remplacé récurrence et convolution en calculant toutes les interactions token-à-token en une seule passe parallèle — mais ce même design est en O(n²) en longueur de séquence, exactement pourquoi chaque variante moderne (FlashAttention, GQA, sliding window) existe pour la relâcher.

De quoi il s'agit

L'attention est le mécanisme qui permet à chaque token d'une séquence de décider, en un seul calcul parallèle, quels autres tokens comptent pour lui et dans quelle mesure. Elle a remplacé la récurrence et la convolution comme opération dominante de modélisation de séquences après l'article fondateur de 2017 « Attention Is All You Need », et tout modèle grand public qu'un consultant citera — GPT, Claude, Gemini, Llama, Mistral — est un empilement de couches d'attention enveloppées dans des blocs à propagation avant. La comprendre n'est pas une curiosité académique pour un praticien de l'analytique SAP ; c'est le concept qui explique pourquoi le contexte long coûte cher, pourquoi le dimensionnement GPU d'un déploiement auto-hébergé est difficile, et pourquoi la facture par token d'une API se comporte comme elle le fait.

Pourquoi c'est important

  • La mise à l'échelle par √dₖ dans softmax(QKᵀ/√dₖ) existe précisément pour empêcher les produits scalaires de saturer le softmax en haute dimension.
  • Le masquage causal dans les décodeurs annule l'attention sur les tokens futurs — la raison mécanique pour laquelle la génération autorégressive fonctionne un token à la fois.
  • Le coût O(n²·d) est le moteur direct de la facture par token d'un déploiement Joule — ajuster la longueur de contexte ou déboguer la latence revient à ajuster le coût d'attention.

Points clés

  • Formule du produit scalaire mis à l'échelle — softmax(Q·Kᵀ / √dₖ)·V — trois projections par token, une somme pondérée par softmax.
  • La mise à l'échelle par √dₖ évite la saturation du softmax en haute dimension ; sans elle, les gradients s'évanouissent sur les grands modèles.
  • Coût en O(n²·d) en calcul et mémoire — quadratique en la longueur n de séquence, linéaire en la dimension d des têtes.
  • Le masque causal dans les décodeurs annule l'attention sur les tokens futurs, imposant une génération gauche-à-droite.
  • Toutes les optimisations LLM depuis 2017 (FlashAttention, GQA, MQA, fenêtre glissante, sparse) attaquent le mur O(n²).
  • L'attention multi-têtes exécute plusieurs calculs d'attention en parallèle avec des projections Q/K/V apprises différentes, puis concatène et reprojette les résultats — l'unité réellement utilisée en production, pas la formule à une seule tête prise isolément.
  • FlashAttention et FlashAttention-2 ne changent pas ce que l'attention calcule, seulement la façon dont le GPU le calcule — la fusion de noyaux consciente des E/S réduit la latence et le trafic mémoire sans toucher à la complexité asymptotique O(n²).
  • Le generative AI hub de SAP facture au token via les AI Units, si bien que le coût quadratique de l'attention se répercute directement en consommation mesurée sur la facture SAP d'un client, et non en une ligne d'infrastructure séparée.

Termes employés sur cette page

Query / Key / Value (Q, K, V)
Trois projections linéaires de l'embedding de chaque token d'entrée. Q pose la question (« que cherche-je ? »), K annonce la réponse (« que contiens-je ? »), V porte la charge utile qui est mélangée dans la sortie.
Softmax
La fonction de normalisation qui transforme les scores bruts de produit scalaire en une distribution de probabilité sur les tokens. Sature (les gradients s'annulent) lorsque les entrées sont trop grandes — la raison du facteur d'échelle √dₖ.
Causal mask
Un masque triangulaire appliqué avant le softmax dans les modèles decoder-only afin que chaque position n'attende qu'à elle-même et aux positions antérieures ; impose une génération autorégressive de gauche à droite.
Head dimension (dₖ)
La taille des vecteurs Q/K/V de chaque tête d'attention. Valeurs typiques 64 ou 128 ; dimension d'embedding totale du modèle = num_heads × dₖ.
Attention multi-têtes
Exécuter h calculs d'attention indépendants en parallèle, chacun avec ses propres projections Q/K/V apprises, puis concaténer et reprojeter linéairement les résultats — permet à une couche d'attendre à plusieurs relations (syntaxe, coréférence, position) à la fois.
FlashAttention
Un noyau GPU conscient des E/S (Dao et al., 2022 ; v2 en 2023) qui fusionne le calcul d'attention par blocs afin de ne jamais matérialiser la matrice d'attention n×n complète dans la mémoire à large bande du GPU, réduisant la latence sans changer la complexité de calcul O(n²).

Sources

  1. Vaswani et al. — Attention Is All You Need (NeurIPS 2017)
  2. Stanford CS25 — Transformers United (lecture notes 2024-2026)
  3. SAP Business AI — official product page
  4. SAP Generative AI — official product page
  5. arXiv — FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (Dao et al., 2022)
  6. arXiv — FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning (Dao, 2023)
  7. SAP Help Portal — Orchestration service, generative AI hub (grounding, masking, filtering pipeline)
  8. SAP Help Portal — Generative AI hub in SAP AI Core (model access overview)
  9. Anthropic — Context windows documentation (2026 model context/output limits)
  10. SAP Help Portal — Metering and pricing for generative AI on SAP AI Core (AI Units)
  11. SAP Community — Why SAP needs a Knowledge Graph: giving enterprise AI a map of the business (2026)
  12. SAP — SAP-RPT tabular foundation model product page (contrast: in-context learning without sequential-token attention)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →