Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral ?
À 100K tokens, la matrice d'attention seule nécessite ~40 Go de mémoire FP16 — les patterns d'attention parcimonieuse (sliding-window, global-local, block-sparse) sont la seule raison pour laquelle des modèles à long contexte comme Claude 200K ou Gemini 1M restent économiquement viables.
De quoi il s'agit
Les motifs d'attention parcimonieuse existent pour résoudre un problème arithmétique précis : l'auto-attention standard coûte O(n²) en longueur de séquence n, parce que chaque token porte attention à chaque autre token. À 100 000 tokens, la seule matrice d'attention nécessite environ 40 Go de mémoire FP16, et ce coût domine à la fois le temps de calcul et la latence bien avant que le reste du modèle ne devienne le goulot d'étranglement. L'attention parcimonieuse est la famille de techniques qui ramène ce coût à environ O(n·k) ou O(n·log n) en restreignant chaque token à un sous-ensemble structuré de k positions plutôt qu'à la séquence entière — et c'est précisément la raison architecturale pour laquelle des modèles à contexte long comme Claude à 200 000 tokens, Gemini à 1 million de tokens ou GPT-4 Turbo à 128 000 tokens sont économiquement viables, et non de simples curiosités théoriques.
Pourquoi c'est important
- La fenêtre w=4096 de Mistral 7B sur 32 couches donne un champ réceptif effectif de 131K tokens malgré une fenêtre nominale de 8K.
- Le pattern global-local de BigBird ajoute un petit ensemble de tokens globaux qui s'attendent à tout, corrigeant la faiblesse centrale de la parcimonie purement locale.
- L'attention parcimonieuse suppose que la localité domine la pertinence, ce qui se brise sur les tâches de raisonnement véritablement global (un fait en position 5K devant informer une génération en position 95K) sauf compensation par tokens globaux ou stacks hybrides dense-parcimonieux.
Points clés
- L'auto-attention vanilla est en O(n²) — à 100K tokens l'attention dense seule nécessite ~40 Go FP16 ; la parcimonieuse réduit à O(n·k) ou O(n·log n).
- Sliding-window (Longformer, Mistral 7B avec w=4096) — le champ réceptif croît linéairement avec la profondeur ; 32 couches × 4096 = 131K réceptif effectif à fenêtre nominale 8K.
- Global-local (BigBird) — fenêtre glissante + tokens globaux (CLS, ancres) + liens parcimonieux aléatoires préservent l'expressivité théorique.
- Block-sparse / dilaté — partitionner la séquence en blocs, dense intra, sélectif inter ; sous-tend les couches d'attention Mixtral 8x7B.
- Arbitrage — suppose que la localité domine ; le raisonnement global multi-documents nécessite des tokens globaux ou des stacks hybrides dense-parcimonieux (certaines variantes Claude apparemment hybrides).
Termes employés sur cette page
- Sliding-window attention
- Chaque token attend à w voisins de chaque côté ; coût O(n·w) ; le champ récepteur croît linéairement avec la profondeur. Utilisé dans Longformer (2020) et Mistral 7B (2023, w=4096).
- Global tokens
- Un petit ensemble de tokens spéciaux qui attendent à toute position et auxquels toute position attend ; utilisé dans BigBird pour préserver la circulation de l'information globale malgré l'attention à fenêtre locale.
- Receptive field
- L'ensemble des positions d'entrée pouvant influencer une position de sortie donnée ; dans l'attention à fenêtre glissante il croît de w par couche, de sorte que L couches × fenêtre w = L·w de champ récepteur effectif.
- Block-sparse attention
- Motif d'attention où la séquence est partitionnée en blocs ; l'attention est dense au sein de chaque bloc et sélective (ou nulle) entre blocs ; sous-tend l'inférence efficace en contexte long dans Mixtral et modèles similaires.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
- Control plane
- La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Longformer: The Long-Document Transformer (Beltagy et al., 2020)
- Big Bird: Transformers for Longer Sequences (Zaheer et al., 2020)
- Mistral 7B technical report (sliding-window attention)
- Anthropic Claude 200K context — engineering blog
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.