Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral

Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral ?

À 100K tokens, la matrice d'attention seule nécessite ~40 Go de mémoire FP16 — les patterns d'attention parcimonieuse (sliding-window, global-local, block-sparse) sont la seule raison pour laquelle des modèles à long contexte comme Claude 200K ou Gemini 1M restent économiquement viables.

De quoi il s'agit

Les motifs d'attention parcimonieuse existent pour résoudre un problème arithmétique précis : l'auto-attention standard coûte O(n²) en longueur de séquence n, parce que chaque token porte attention à chaque autre token. À 100 000 tokens, la seule matrice d'attention nécessite environ 40 Go de mémoire FP16, et ce coût domine à la fois le temps de calcul et la latence bien avant que le reste du modèle ne devienne le goulot d'étranglement. L'attention parcimonieuse est la famille de techniques qui ramène ce coût à environ O(n·k) ou O(n·log n) en restreignant chaque token à un sous-ensemble structuré de k positions plutôt qu'à la séquence entière — et c'est précisément la raison architecturale pour laquelle des modèles à contexte long comme Claude à 200 000 tokens, Gemini à 1 million de tokens ou GPT-4 Turbo à 128 000 tokens sont économiquement viables, et non de simples curiosités théoriques.

Pourquoi c'est important

  • La fenêtre w=4096 de Mistral 7B sur 32 couches donne un champ réceptif effectif de 131K tokens malgré une fenêtre nominale de 8K.
  • Le pattern global-local de BigBird ajoute un petit ensemble de tokens globaux qui s'attendent à tout, corrigeant la faiblesse centrale de la parcimonie purement locale.
  • L'attention parcimonieuse suppose que la localité domine la pertinence, ce qui se brise sur les tâches de raisonnement véritablement global (un fait en position 5K devant informer une génération en position 95K) sauf compensation par tokens globaux ou stacks hybrides dense-parcimonieux.

Points clés

  • L'auto-attention vanilla est en O(n²) — à 100K tokens l'attention dense seule nécessite ~40 Go FP16 ; la parcimonieuse réduit à O(n·k) ou O(n·log n).
  • Sliding-window (Longformer, Mistral 7B avec w=4096) — le champ réceptif croît linéairement avec la profondeur ; 32 couches × 4096 = 131K réceptif effectif à fenêtre nominale 8K.
  • Global-local (BigBird) — fenêtre glissante + tokens globaux (CLS, ancres) + liens parcimonieux aléatoires préservent l'expressivité théorique.
  • Block-sparse / dilaté — partitionner la séquence en blocs, dense intra, sélectif inter ; sous-tend les couches d'attention Mixtral 8x7B.
  • Arbitrage — suppose que la localité domine ; le raisonnement global multi-documents nécessite des tokens globaux ou des stacks hybrides dense-parcimonieux (certaines variantes Claude apparemment hybrides).

Termes employés sur cette page

Sliding-window attention
Chaque token attend à w voisins de chaque côté ; coût O(n·w) ; le champ récepteur croît linéairement avec la profondeur. Utilisé dans Longformer (2020) et Mistral 7B (2023, w=4096).
Global tokens
Un petit ensemble de tokens spéciaux qui attendent à toute position et auxquels toute position attend ; utilisé dans BigBird pour préserver la circulation de l'information globale malgré l'attention à fenêtre locale.
Receptive field
L'ensemble des positions d'entrée pouvant influencer une position de sortie donnée ; dans l'attention à fenêtre glissante il croît de w par couche, de sorte que L couches × fenêtre w = L·w de champ récepteur effectif.
Block-sparse attention
Motif d'attention où la séquence est partitionnée en blocs ; l'attention est dense au sein de chaque bloc et sélective (ou nulle) entre blocs ; sous-tend l'inférence efficace en contexte long dans Mixtral et modèles similaires.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
Control plane
La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. Longformer: The Long-Document Transformer (Beltagy et al., 2020)
  2. Big Bird: Transformers for Longer Sequences (Zaheer et al., 2020)
  3. Mistral 7B technical report (sliding-window attention)
  4. Anthropic Claude 200K context — engineering blog
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →