AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral

Patterns d'attention parcimonieuse — Longformer / BigBird / Mixtral — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Patterns d'attention parcimonieuse ?

À 100K tokens, la matrice d'attention seule nécessite ~40 Go de mémoire FP16 — les patterns d'attention parcimonieuse (sliding-window, global-local, block-sparse) sont la seule raison pour laquelle des modèles à long contexte comme Claude 200K ou Gemini 1M restent économiquement viables.

De quoi il s'agit

Les motifs d'attention parcimonieuse existent pour résoudre un problème arithmétique précis : l'auto-attention standard coûte O(n²) en longueur de séquence n, parce que chaque token porte attention à chaque autre token. À 100 000 tokens, la seule matrice d'attention nécessite environ 40 Go de mémoire FP16, et ce coût domine à la fois le temps de calcul et la latence bien avant que le reste du modèle ne devienne le goulot d'étranglement. L'attention parcimonieuse est la famille de techniques qui ramène ce coût à environ O(n·k) ou O(n·log n) en restreignant chaque token à un sous-ensemble structuré de k positions plutôt qu'à la séquence entière — et c'est précisément la raison architecturale pour laquelle des modèles à contexte long comme Claude à 200 000 tokens, Gemini à 1 million de tokens ou GPT-4 Turbo à 128 000 tokens sont économiquement viables, et non de simples curiosités théoriques.

Pourquoi c'est important

  • La fenêtre w=4096 de Mistral 7B sur 32 couches donne un champ réceptif effectif de 131K tokens malgré une fenêtre nominale de 8K.
  • Le pattern global-local de BigBird ajoute un petit ensemble de tokens globaux qui s'attendent à tout, corrigeant la faiblesse centrale de la parcimonie purement locale.
  • L'attention parcimonieuse suppose que la localité domine la pertinence, ce qui se brise sur les tâches de raisonnement véritablement global (un fait en position 5K devant informer une génération en position 95K) sauf compensation par tokens globaux ou stacks hybrides dense-parcimonieux.

Points clés

  • L'auto-attention vanilla est en O(n²) — à 100K tokens l'attention dense seule nécessite ~40 Go FP16 ; la parcimonieuse réduit à O(n·k) ou O(n·log n).
  • Sliding-window (Longformer, Mistral 7B avec w=4096) — le champ réceptif croît linéairement avec la profondeur ; 32 couches × 4096 = 131K réceptif effectif à fenêtre nominale 8K.
  • Global-local (BigBird) — fenêtre glissante + tokens globaux (CLS, ancres) + liens parcimonieux aléatoires préservent l'expressivité théorique.
  • Block-sparse / dilaté — partitionner la séquence en blocs, dense intra, sélectif inter ; sous-tend les couches d'attention Mixtral 8x7B.
  • Arbitrage — suppose que la localité domine ; le raisonnement global multi-documents nécessite des tokens globaux ou des stacks hybrides dense-parcimonieux (certaines variantes Claude apparemment hybrides).
  • Pour un appel hébergé sur le generative AI hub, le motif d'attention parcimonieuse précis derrière Claude, GPT, Gemini ou Mistral n'est ni configurable ni divulgué — l'alternative gouvernée de SAP (document grounding, SAP Knowledge Graph) est ce qu'un consultant contrôle réellement.
  • Nommer le motif précis compte lors de la comparaison de candidats auto-hébergés sur SAP AI Core : « utilise de l'attention parcimonieuse » ne prédit rien en soi, tandis que sliding-window, global-local ou block-sparse impliquent chacun un arbitrage coût-rappel différent.

Termes employés sur cette page

Sliding-window attention
Chaque token attend à w voisins de chaque côté ; coût O(n·w) ; le champ récepteur croît linéairement avec la profondeur. Utilisé dans Longformer (2020) et Mistral 7B (2023, w=4096).
Global tokens
Un petit ensemble de tokens spéciaux qui attendent à toute position et auxquels toute position attend ; utilisé dans BigBird pour préserver la circulation de l'information globale malgré l'attention à fenêtre locale.
Receptive field
L'ensemble des positions d'entrée pouvant influencer une position de sortie donnée ; dans l'attention à fenêtre glissante il croît de w par couche, de sorte que L couches × fenêtre w = L·w de champ récepteur effectif.
Block-sparse attention
Motif d'attention où la séquence est partitionnée en blocs ; l'attention est dense au sein de chaque bloc et sélective (ou nulle) entre blocs ; sous-tend l'inférence efficace en contexte long dans Mixtral et modèles similaires.
Attention dense (complète)
Le motif de référence en O(n²) où chaque token attend à tous les autres ; le point de comparaison contre lequel tout motif parcimonieux s'échange, et encore le bon défaut sous environ 8K tokens, où le coût quadratique n'est pas encore pénalisant.
Audit du motif d'attention
La pratique consistant à demander à un éditeur ou à vérifier sur une fiche de modèle le motif d'attention parcimonieuse exact et sa composition couche par couche — quelles couches sont en sliding-window, global-local ou complète — avant de faire confiance à une affirmation de longueur de contexte pour un cas d'usage SAP précis.

Sources

  1. Longformer: The Long-Document Transformer (Beltagy et al., 2020)
  2. Big Bird: Transformers for Longer Sequences (Zaheer et al., 2020)
  3. Mistral 7B technical report (sliding-window attention)
  4. Anthropic Claude 200K context — engineering blog
  5. SAP Generative AI — official product page
  6. arXiv — FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (Dao et al., 2022)
  7. arXiv — FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning (Dao, 2023)
  8. Mistral AI — Announcing Mistral 7B (2023): confirms sliding window attention w=4096
  9. Mistral AI — Mixtral of Experts announcement (2023)
  10. SAP Help Portal — Generative AI hub in SAP AI Core (hosted model endpoints)
  11. SAP Help Portal — Orchestration service (document grounding pipeline module)
  12. SAP Community — Why SAP needs a Knowledge Graph: giving enterprise AI a map of the business (2026)
  13. Databricks — Model Serving documentation (self-hosting open-weight checkpoints)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →