Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Sliding Window Attention — l'Astuce Long-Contexte de Mistral

Sliding Window Attention — l'Astuce Long-Contexte de Mistral — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que Sliding Window Attention — l'Astuce Long-Contexte de Mistral ?

Mistral 7B annonce 32K de contexte effectif en restreignant l'attention de chaque token à une fenêtre de 4K et en laissant le champ réceptif effectif se composer sur 32 couches empilées, au lieu de payer le coût O(n²) de l'attention complète.

De quoi il s'agit

Sliding Window Attention (SWA) restreint l'attention de chaque token à une fenêtre de taille fixe de tokens proches — typiquement 4K — au lieu de porter son attention sur toute la séquence. En empilant plusieurs de ces couches, l'information se propage encore sur de longues distances (chaque couche étend le champ réceptif effectif), mais le coût par couche tombe de O(n²) à O(n·w) où w est la taille de la fenêtre. L'architecture a été popularisée par Longformer (2020) et BigBird (2020) en recherche, et portée à l'échelle production par Mistral 7B (2023), qui a combiné SWA avec un cache KV glissant pour annoncer 32K de contexte effectif sur du matériel qui ne pouvait auparavant pas le permettre.

Pourquoi cela existe. Le coût quadratique de l'attention complète domine la mémoire et le calcul GPU au-delà de ~8K tokens; FlashAttention (C214) aide sur le facteur constant mais pas sur l'asymptotique. Pour des applications où la majorité de l'information pertinente se trouve à quelques milliers de tokens de chaque position (longs documents, bases de code, chat multi-tour), l'attention complète est gaspilleuse. SWA exploite cette localité directement.

Pourquoi c'est important

  • Le coût par couche tombe de O(n²) à O(n·w), et un cache KV glissant maintient la mémoire par requête à O(w) au lieu de O(n) en évinçant les tokens hors fenêtre.
  • Un modèle à 32 couches avec w=4096 atteint un champ réceptif théorique de ~128K uniquement en empilant les fenêtres glissantes.
  • Le SWA pur peut perdre de l'information nécessitant plus de sauts que la profondeur du modèle ne le permet — d'où le mélange de Mistral Large et Mixtral 8x22B avec des couches d'attention complète périodiques.

Points clés

  • Chaque token n'attend que sur les w tokens précédents (fenêtre glissante causale) — coût O(n·w) par couche contre O(n²) pour l'attention complète.
  • Le champ réceptif effectif croît jusqu'à L · w sur L couches empilées ; un Mistral 7B 32 couches (w=4096) atteint ~128K de portée théorique.
  • Mistral 7B utilise du SWA-4096 pur + cache KV glissant — mémoire KV par requête plafonnée et contexte 32K annoncé.
  • Mistral Large, Mixtral, Gemini 1.5 et Claude utilisent un hybride SWA + couches d'attention complète périodiques pour retrouver la fidélité longue portée.
  • Prédécesseurs — Longformer (2020) et BigBird (2020) — ont établi le motif en recherche ; Mistral 7B (2023) fut la percée en production.

Termes employés sur cette page

Sliding Window Attention (SWA)
Un motif d'attention où chaque token n'attend qu'aux w tokens précédents les plus proches, réduisant le coût par couche de O(n²) à O(n·w). L'information se propage sur de plus longues distances par empilement de couches.
Rolling KV cache
Une optimisation à l'inférence qui évince les entrées Key/Value des tokens situés hors de la fenêtre glissante courante, plafonnant la mémoire KV par requête à O(w) indépendamment de la longueur totale de la séquence. L'astuce signature de Mistral 7B.
Effective receptive field
La distance maximale sur laquelle l'information peut se propager de l'entrée à la sortie à travers des couches SWA empilées, égale à L · w pour L couches avec une fenêtre w. Distinct de la « fenêtre de contexte » annoncée.
Hybrid attention
Une architecture entrelaçant des couches SWA avec des couches d'attention complète périodiques (p. ex. toutes les 4 ou toutes les 8). Utilisée par Mistral Large, Mixtral, Gemini 1.5 et Claude pour récupérer la fidélité longue portée que la SWA pure peut perdre.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
Control plane
La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. Beltagy et al. — Longformer: The Long-Document Transformer (2020)
  2. Jiang et al. — Mistral 7B (2023) — Sliding Window Attention and Rolling Buffer Cache
  3. Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
  4. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  5. SAP News Center — SAP Unveils the Autonomous Enterprise
  6. SAP News Center — The Future of the Enterprise Is Autonomous
  7. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  8. SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →