Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Variantes d'attention

Variantes d'attention — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Variantes d'attention ?

Le cache KV, et non les poids du modèle, est la contrainte mémoire déterminante en production — l'attention multi-têtes vanilla pousse une seule requête sur un modèle 70B à ~336 Go à 128K tokens, ce qui explique pourquoi GQA (réduction ×8) est désormais l'optimum de Pareto par défaut.

De quoi il s'agit

Les variantes d'attention forment la famille de modifications d'ingénierie apportées au mécanisme original d'auto-attention multi-têtes à l'intérieur d'un transformeur, et le choix entre elles est sans doute le plus grand levier qu'une équipe puisse actionner pour maîtriser le coût d'exécution d'un grand modèle de langage à l'échelle. L'attention multi-têtes classique, le mécanisme introduit dans l'article original sur les transformeurs, donne à chaque tête d'attention son propre jeu indépendant de projections de requête, de clé et de valeur. Cette conception maximise la richesse de représentation du modèle, mais elle signifie aussi que, pendant la génération autorégressive, le modèle doit mettre en cache un vecteur de clé et un vecteur de valeur pour chaque tête, à chaque couche, pour chaque token déjà généré — ce qu'on appelle le cache clé-valeur. Pour un grand modèle comportant de nombreuses têtes, une fenêtre de contexte longue et un lot raisonnablement dimensionné de requêtes concurrentes, ce cache — et non les poids du modèle — devient la contrainte déterminante sur le matériel nécessaire au déploiement et sur le nombre d'utilisateurs qu'il peut servir simultanément.

Pourquoi c'est important

  • Le choix de variante d'attention est désigné comme le plus grand levier de coût d'inférence — plus important que la quantisation, le batching ou le choix de matériel dans la plupart des déploiements.
  • La réduction KV de 8× de GQA avec une qualité « compétitive avec MHA » est le chiffre concret qui justifie pourquoi Llama 3.3 70B utilise H_kv=8 plutôt qu'une MHA complète.
  • PagedAttention élimine jusqu'à 60 % de fragmentation mémoire, portant l'utilisation GPU bien au-delà des ~40 % typiques d'une allocation contiguë — un levier de coût direct pour l'inférence auto-hébergée.

Points clés

  • Le KV cache (et non les poids du modèle) est la contrainte mémoire GPU déterminante dans le serving LLM — MHA à 128K de contexte nécessite ~336 GB pour Llama 3.3 70B ; GQA réduit cela de 8× à ~42 GB.
  • GQA (H_q=64, H_kv=8 sur Llama 3.3 70B) est l'optimum de Pareto : réduction 8× du KV avec une qualité compétitive face à MHA — le défaut de l'industrie depuis 2023 (Llama 3, Mistral, Gemma 2, Falcon 180B).
  • MQA (H_kv=1) maximise les économies mémoire mais dégrade la qualité sur le raisonnement multi-étapes — à utiliser uniquement pour les déploiements edge à latence ultra-faible où la régression est mesurée et acceptée.
  • FlashAttention-3 atteint 75% d'utilisation FLOP sur H100 contre 35% pour un SDPA naïf — une optimisation de kernel orthogonale sans aucun compromis de qualité, applicable par-dessus n'importe quelle variante structurelle.
  • PagedAttention (vLLM, Kwon 2023) virtualise le KV cache, éliminant jusqu'à 60% de la fragmentation mémoire et faisant passer l'utilisation GPU de ~40% à ~90% en serving multi-utilisateurs.
  • PyTorch SDPA, depuis la version 2.0, bascule automatiquement vers FlashAttention quand les entrées respectent les exigences du kernel CUDA — aucun opt-in explicite nécessaire pour les stacks d'inférence basées sur PyTorch.
  • SAP BTP AI Core utilise une infrastructure de serving compatible vLLM pour les déploiements de modèles open-weight — les bénéfices de FlashAttention et PagedAttention s'appliquent directement en self-hosting sur Kyma.
  • Pour un modèle 70B servant 50 utilisateurs concurrents à 4K de contexte sur 4× A100 80GB : GQA + FlashAttention + vLLM (PagedAttention) est la seule configuration qui tient en mémoire avec un débit acceptable.
  • Multi-head Latent Attention (MLA, DeepSeek-V2 2024) compresse encore davantage le KV via une projection de rang faible — variante émergente, pas encore mainstream mais directionnellement pertinente pour les scénarios à très long contexte.
  • La différence d'utilisation matérielle (FlashAttention : 75% contre naïf : 35%) se traduit directement par ~2× de débit sur le même GPU — pour un cluster d'inférence en production, c'est l'optimisation logicielle au meilleur ROI disponible.

Termes employés sur cette page

MHA (Multi-Head Attention)
Mécanisme d'attention d'origine (Vaswani 2017) : H jeux indépendants de projections Q, K, V. Expressivité maximale ; empreinte mémoire maximale du KV cache sur les contextes longs.
GQA (Grouped-Query Attention)
Variante d'attention (Ainslie 2023) : H_q têtes de requête partagent G groupes de projections K/V où H_kv = G < H_q. Optimum de Pareto actuel — réduction du KV par 8× pour une qualité compétitive face à MHA. Par défaut dans Llama 3, Mistral, Gemma 2.
MQA (Multi-Query Attention)
Compression KV extrême (Shazeer 2019) : H_kv=1 — toutes les têtes de requête partagent une unique projection K/V. Gain mémoire de H× ; régression de qualité mesurable sur le raisonnement multi-étapes. Utilisée dans PaLM ; supplantée par GQA dans la plupart des modèles modernes.
FlashAttention
Implémentation d'attention consciente des I/O (Dao 2022–2024) : découpe le calcul Q/K/V en tuiles au sein de la SRAM pour éviter les lectures répétées en HBM. Atteint une mémoire d'activation en O(n) contre O(n²), et 75 % d'utilisation des FLOP du H100 contre 35 % pour l'implémentation naïve. Orthogonale au choix de la variante structurelle.
KV cache
Les tenseurs de projection clé-valeur mis en cache issus de toutes les étapes d'attention précédentes du décodage autorégressif. La mémoire croît en O(n_layers × H_kv × d_head × seq_len × batch_size) — la contrainte mémoire GPU déterminante du service de LLM, et non les poids du modèle.
PagedAttention
Gestion du KV cache inspirée de la mémoire virtuelle (Kwon 2023, vLLM) : alloue le KV cache en pages non contiguës via des tables de pages à la manière d'un OS. Élimine jusqu'à 60 % de la fragmentation mémoire ; porte l'utilisation GPU de ~40 % à ~90 % en service multi-utilisateurs.
HBM (High-Bandwidth Memory)
La mémoire GPU principale (p. ex. 80 Go sur A100/H100) : plus lente que la SRAM mais bien plus grande. L'idée clé de FlashAttention est de minimiser les lectures HBM en conservant les calculs d'attention intermédiaires dans la SRAM on-chip, plus rapide.
SRAM (on-chip cache)
La mémoire on-chip rapide d'un GPU (p. ex. ~20 Mo sur A100, ~256 Ko de L1 par SM) : plus rapide que la HBM de plusieurs ordres de grandeur mais bien plus petite. FlashAttention découpe le calcul d'attention en tuiles pour tenir dans la SRAM, réduisant drastiquement le coût de bande passante mémoire.

Sources

  1. Vaswani et al. 2017 — Attention Is All You Need
  2. Shazeer 2019 — Fast Transformer Decoding: One Write-Head is All You Need (MQA)
  3. Ainslie et al. 2023 — GQA: Training Generalised Multi-Query Transformer Models
  4. Dao et al. 2023 — FlashAttention-2
  5. Shah et al. 2024 — FlashAttention-3: Fast and Accurate Attention on Hopper GPUs
  6. Kwon et al. 2023 — Efficient Memory Management for LLM Serving with PagedAttention
  7. Meta AI — Llama 3 Model Card
  8. vLLM documentation — PagedAttention and serving architecture
  9. PyTorch documentation — scaled_dot_product_attention and FlashAttention dispatch
  10. SAP BTP AI Core — Generative AI Hub documentation
  11. SAP News Center — SAP Unveils the Autonomous Enterprise
  12. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  13. SAP Datasphere — Help Portal
  14. SAP Datasphere — official product page
  15. SAP Analytics Cloud — Help Portal
  16. SAP Analytics Cloud — official product page
  17. SAP BW/4HANA — Help Portal
  18. SAP S/4HANA — Help Portal
  19. SAP News Center
  20. SAP Community
  21. SAP — industries overview
  22. SAP Business AI — official product page
  23. SAP Joule (work companion) — official product page
  24. SAP Generative AI — official product page
  25. Stanford HAI — AI Index Report
  26. Meta AI — Llama model research
  27. arXiv — preprint archive (cs.CL/cs.AI)
  28. HuggingFace — model hub
  29. Gartner — research & analyst site
  30. BARC — BI & Analytics research
  31. TDWI — data & analytics research
  32. DSAG — German-speaking SAP user group
  33. ASUG — Americas' SAP User Group
  34. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →