Sliding Window Attention — l'Astuce Long-Contexte de Mistral
À jour au 2026-07-23
Qu'est-ce que Sliding Window Attention — l'Astuce Long-Contexte de Mistral ?
Mistral 7B annonce 32K de contexte effectif en restreignant l'attention de chaque token à une fenêtre de 4K et en laissant le champ réceptif effectif se composer sur 32 couches empilées, au lieu de payer le coût O(n²) de l'attention complète.
De quoi il s'agit
Sliding Window Attention (SWA) restreint l'attention de chaque token à une fenêtre de taille fixe de tokens proches — typiquement 4K — au lieu de porter son attention sur toute la séquence. En empilant plusieurs de ces couches, l'information se propage encore sur de longues distances (chaque couche étend le champ réceptif effectif), mais le coût par couche tombe de O(n²) à O(n·w) où w est la taille de la fenêtre. L'architecture a été popularisée par Longformer (2020) et BigBird (2020) en recherche, et portée à l'échelle production par Mistral 7B (2023), qui a combiné SWA avec un cache KV glissant pour annoncer 32K de contexte effectif sur du matériel qui ne pouvait auparavant pas le permettre.
Pourquoi cela existe. Le coût quadratique de l'attention complète domine la mémoire et le calcul GPU au-delà de ~8K tokens; FlashAttention (C214) aide sur le facteur constant mais pas sur l'asymptotique. Pour des applications où la majorité de l'information pertinente se trouve à quelques milliers de tokens de chaque position (longs documents, bases de code, chat multi-tour), l'attention complète est gaspilleuse. SWA exploite cette localité directement.
Pourquoi c'est important
- Le coût par couche tombe de O(n²) à O(n·w), et un cache KV glissant maintient la mémoire par requête à O(w) au lieu de O(n) en évinçant les tokens hors fenêtre.
- Un modèle à 32 couches avec w=4096 atteint un champ réceptif théorique de ~128K uniquement en empilant les fenêtres glissantes.
- Le SWA pur peut perdre de l'information nécessitant plus de sauts que la profondeur du modèle ne le permet — d'où le mélange de Mistral Large et Mixtral 8x22B avec des couches d'attention complète périodiques.
Points clés
- Chaque token n'attend que sur les w tokens précédents (fenêtre glissante causale) — coût O(n·w) par couche contre O(n²) pour l'attention complète.
- Le champ réceptif effectif croît jusqu'à L · w sur L couches empilées ; un Mistral 7B 32 couches (w=4096) atteint ~128K de portée théorique.
- Mistral 7B utilise du SWA-4096 pur + cache KV glissant — mémoire KV par requête plafonnée et contexte 32K annoncé.
- Mistral Large, Mixtral, Gemini 1.5 et Claude utilisent un hybride SWA + couches d'attention complète périodiques pour retrouver la fidélité longue portée.
- Prédécesseurs — Longformer (2020) et BigBird (2020) — ont établi le motif en recherche ; Mistral 7B (2023) fut la percée en production.
Termes employés sur cette page
- Sliding Window Attention (SWA)
- Un motif d'attention où chaque token n'attend qu'aux w tokens précédents les plus proches, réduisant le coût par couche de O(n²) à O(n·w). L'information se propage sur de plus longues distances par empilement de couches.
- Rolling KV cache
- Une optimisation à l'inférence qui évince les entrées Key/Value des tokens situés hors de la fenêtre glissante courante, plafonnant la mémoire KV par requête à O(w) indépendamment de la longueur totale de la séquence. L'astuce signature de Mistral 7B.
- Effective receptive field
- La distance maximale sur laquelle l'information peut se propager de l'entrée à la sortie à travers des couches SWA empilées, égale à L · w pour L couches avec une fenêtre w. Distinct de la « fenêtre de contexte » annoncée.
- Hybrid attention
- Une architecture entrelaçant des couches SWA avec des couches d'attention complète périodiques (p. ex. toutes les 4 ou toutes les 8). Utilisée par Mistral Large, Mixtral, Gemini 1.5 et Claude pour récupérer la fidélité longue portée que la SWA pure peut perdre.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
- Control plane
- La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Beltagy et al. — Longformer: The Long-Document Transformer (2020)
- Jiang et al. — Mistral 7B (2023) — Sliding Window Attention and Rolling Buffer Cache
- Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.