Sliding Window Attention — l'Astuce Long-Contexte de Mistral
À jour au 2026-10-04
Qu'est-ce que Sliding Window Attention ?
Mistral 7B annonce 32K de contexte effectif en restreignant l'attention de chaque token à une fenêtre de 4K et en laissant le champ réceptif effectif se composer sur 32 couches empilées, au lieu de payer le coût O(n²) de l'attention complète.
De quoi il s'agit
Sliding Window Attention (SWA) restreint l'attention de chaque token à une fenêtre de taille fixe de tokens proches — typiquement 4K — au lieu de porter son attention sur toute la séquence. En empilant plusieurs de ces couches, l'information se propage encore sur de longues distances (chaque couche étend le champ réceptif effectif), mais le coût par couche tombe de O(n²) à O(n·w) où w est la taille de la fenêtre. L'architecture a été popularisée par Longformer (2020) et BigBird (2020) en recherche, et portée à l'échelle production par Mistral 7B (2023), qui a combiné SWA avec un cache KV glissant pour annoncer 32K de contexte effectif sur du matériel qui ne pouvait auparavant pas le permettre.
Pourquoi cela existe. Le coût quadratique de l'attention complète domine la mémoire et le calcul GPU au-delà de ~8K tokens; FlashAttention (C214) aide sur le facteur constant mais pas sur l'asymptotique. Pour des applications où la majorité de l'information pertinente se trouve à quelques milliers de tokens de chaque position (longs documents, bases de code, chat multi-tour), l'attention complète est gaspilleuse. SWA exploite cette localité directement.
Pourquoi c'est important
- Le coût par couche tombe de O(n²) à O(n·w), et un cache KV glissant maintient la mémoire par requête à O(w) au lieu de O(n) en évinçant les tokens hors fenêtre.
- Un modèle à 32 couches avec w=4096 atteint un champ réceptif théorique de ~128K uniquement en empilant les fenêtres glissantes.
- Le SWA pur peut perdre de l'information nécessitant plus de sauts que la profondeur du modèle ne le permet — d'où le mélange de Mistral Large et Mixtral 8x22B avec des couches d'attention complète périodiques.
Points clés
- Chaque token n'attend que sur les w tokens précédents (fenêtre glissante causale) — coût O(n·w) par couche contre O(n²) pour l'attention complète.
- Le champ réceptif effectif croît jusqu'à L · w sur L couches empilées ; un Mistral 7B 32 couches (w=4096) atteint ~128K de portée théorique.
- Mistral 7B utilise du SWA-4096 pur + cache KV glissant — mémoire KV par requête plafonnée et contexte 32K annoncé.
- Mistral Large, Mixtral, Gemini 1.5 et Claude utilisent un hybride SWA + couches d'attention complète périodiques pour retrouver la fidélité longue portée.
- Prédécesseurs — Longformer (2020) et BigBird (2020) — ont établi le motif en recherche ; Mistral 7B (2023) fut la percée en production.
- Rien dans Joule, Joule Studio ou le generative AI hub n'expose une taille de fenêtre glissante à configurer — la SWA est entièrement une propriété du checkpoint ouvert qu'une équipe auto-héberge sur SAP AI Core.
- L'hypothèse de localité derrière la SWA se brise spécifiquement sur des documents d'entreprise densément renvoyés — un bon de commande pointant vers une clause de contrat pointant vers une fiche de données de base — la structure exacte de nombreux documents métier SAP.
Termes employés sur cette page
- Sliding Window Attention (SWA)
- Un motif d'attention où chaque token n'attend qu'aux w tokens précédents les plus proches, réduisant le coût par couche de O(n²) à O(n·w). L'information se propage sur de plus longues distances par empilement de couches.
- Rolling KV cache
- Une optimisation à l'inférence qui évince les entrées Key/Value des tokens situés hors de la fenêtre glissante courante, plafonnant la mémoire KV par requête à O(w) indépendamment de la longueur totale de la séquence. L'astuce signature de Mistral 7B.
- Effective receptive field
- La distance maximale sur laquelle l'information peut se propager de l'entrée à la sortie à travers des couches SWA empilées, égale à L · w pour L couches avec une fenêtre w. Distinct de la « fenêtre de contexte » annoncée.
- Hybrid attention
- Une architecture entrelaçant des couches SWA avec des couches d'attention complète périodiques (p. ex. toutes les 4 ou toutes les 8). Utilisée par Mistral Large, Mixtral, Gemini 1.5 et Claude pour récupérer la fidélité longue portée que la SWA pure peut perdre.
- Hypothèse de localité
- Le pari de fond derrière tout motif d'attention parcimonieuse, SWA incluse, selon lequel les tokens proches les uns des autres dans la séquence comptent plus pour une prédiction donnée que les tokens distants. Tient bien pour de la prose naturelle ; s'effondre sur des documents construits autour de renvois denses, comme de nombreux documents métier SAP.
Sources
- Beltagy et al. — Longformer: The Long-Document Transformer (2020)
- Jiang et al. — Mistral 7B (2023) — Sliding Window Attention and Rolling Buffer Cache
- Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
- Mistral AI — Announcing Mistral 7B (2023): confirms sliding window attention w=4096 + GQA
- arXiv — Big Bird: Transformers for Longer Sequences (Zaheer et al., 2020)
- Mistral AI — Mixtral of Experts announcement (2023)
- SAP Help Portal — Generative AI hub in SAP AI Core (hosted model endpoints)
- SAP Help Portal — Metering and pricing for generative AI on SAP AI Core (AI Units)
- SAP Community — Why SAP needs a Knowledge Graph: giving enterprise AI a map of the business (2026)
- Databricks — Model Serving documentation (self-hosting open-weight checkpoints)
- arXiv — FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (Dao et al., 2022)
- Efficient Streaming Language Models with Attention Sinks — Xiao et al., arXiv
- FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning — Dao, arXiv
- GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints — Ainslie et al., arXiv
- Lost in the Middle: How Language Models Use Long Contexts — Liu et al., arXiv
- Mistral model documentation — Hugging Face Transformers
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.