AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Entraînement long-contexte — De 8K à plus d'un million de tokens

Entraînement long-contexte — De 8K à plus d'un million de tokens — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Entraînement long-contexte ?

Étendre le contexte de 8 K à plus d'1 M de tokens est trois problèmes d'ingénierie couplés, pas un seul — extrapolation de l'encodage de position (YaRN), coût d'attention en O(N²) (FlashAttention-3, Ring Attention), et construction de données d'entraînement qui enseigne le raisonnement, pas seulement la mémorisation.

De quoi il s'agit

L'entraînement en contexte long est l'effort d'ingénierie ponctuel qui consiste à prendre un modèle de langage construit et entraîné sur une longueur de contexte modeste — typiquement 8 000 ou 32 000 tokens — et à étendre sa fenêtre utilisable jusqu'aux plages de 200 000 à 2 millions de tokens que les modèles de pointe annoncent aujourd'hui. Ce n'est pas une astuce unique mais trois problèmes couplés qui doivent être résolus ensemble : comment l'information de position survit bien au-delà de sa plage d'entraînement, comment le calcul de l'attention reste praticable malgré son coût quadratique, et comment les données d'entraînement sont construites pour que le modèle apprenne réellement à raisonner sur de longues portées plutôt que de simplement les mémoriser.

Pourquoi c'est important

  • L'extrapolation RoPE naïve se dégrade fortement au-delà de la longueur d'entraînement — YaRN (scaling NTK + correction de température d'attention) est le standard 2026 pour étendre un contexte de 8 K à 128 K+ en quelques centaines de pas de fine-tuning.
  • Ring Attention répartit la séquence sur plusieurs GPUs en topologie anneau, ce qui rend concrètement possible l'entraînement à 1 M+ tokens sur un cluster de 64 GPUs au lieu de nécessiter des pétaoctets de mémoire d'attention.
  • La concaténation aléatoire de documents pour les données d'entraînement produit un modèle qui mémorise les longues séquences mais ne peut pas raisonner dessus — un curriculum de données (textes longs, chaînes QA multi-documents) est ce qui construit réellement une capacité long-contexte utilisable.

Points clés

  • Trois composantes couplées — extrapolation de l'encodage de position (YaRN, NTK, PI), calcul de l'attention (FlashAttention-3, Ring Attention), curriculum des données.
  • Extension RoPE — YaRN est le standard 2026 ; étend un modèle de base 8 K à 128 K+ en quelques centaines de pas de fine-tuning avec perte qualité minimale.
  • Échelle de l'attention — auto-attention complète en O(N²) ; Ring Attention répartit la séquence sur plusieurs GPUs et fait tourner les blocs KV pour permettre l'entraînement 1 M+.
  • Curriculum données — synthèse de données long-contexte depuis livres, dépôts de code, QA multi-documents ; rampe 8 K → 32 K → 128 K pendant le fine-tuning.
  • Évaluation — benchmarks needle-in-haystack (NIAH) et RULER ; la précision long-contexte se dégrade de façon non-monotone — tester à chaque longueur prévue.
  • Le service d'orchestration de SAP implémente l'« ancrage » comme un pipeline RAG géré (ancrage document/base de données), pas comme un motif de bourrage de prompt en contexte long — précisément pour que les Data Access Controls de SAP puissent s'appliquer à chaque fragment récupéré, ce qu'un prompt géant unique ne peut pas supporter.
  • Les modèles Claude actuels, accessibles depuis Joule via l'intégration MCP SAP-Anthropic, embarquent des fenêtres de contexte jusqu'à 1 M de tokens (Sonnet 5, Opus 5.5/5.5 ; Haiku 4.5 à 200 K) — une vraie marge pour la revue holistique d'un document unique, pas une raison d'abandonner la récupération pour des corpus d'entreprise gouvernés.
  • Une fenêtre annoncée plus grande ne supprime pas le besoin de tester le rappel à la longueur réellement utilisée — la dégradation « aiguille au milieu » est une propriété du mécanisme d'attention, pas un chiffre marketing propre à un fournisseur.

Termes employés sur cette page

RoPE (Rotary Position Embedding)
Schéma d'encodage de position qui fait pivoter les vecteurs de requête et de clé d'un angle proportionnel à leur position ; dominant dans les LLM de 2026 car il extrapole mieux que les encodages absolus ou sinusoïdaux.
YaRN
Yet another RoPE extensioN ; une technique introduite en 2023 combinant une mise à l'échelle des fréquences NTK-aware avec une correction de la température d'attention ; le standard 2026 pour étendre les fenêtres de contexte pré-entraînées de 16 à 32×.
Ring Attention
Algorithme d'attention distribuée (Liu et al. 2023) qui fragmente la séquence sur N GPU et fait tourner les blocs clé-valeur dans une topologie en anneau afin que chaque GPU voie le contexte complet au fil de N tours de communication ; permet l'entraînement sur plus d'un million de tokens.
Needle-in-Haystack (NIAH)
Évaluation de long contexte qui insère un fait cible à une position aléatoire dans un long document distracteur et mesure si le modèle le retrouve ; le contrôle de cohérence de base pour la capacité de long contexte.
Position interpolation
Une technique d'extension RoPE qui compresse l'indice de position d'une séquence plus longue pour qu'il retombe dans la plage de fréquence de rotation sur laquelle le modèle a été entraîné à l'origine ; plus simple que YaRN mais dégrade davantage le détail positionnel fin.
NTK-aware scaling
Une technique d'extension RoPE qui ajuste la base de rotation pour préserver les composantes positionnelles haute fréquence (détail fin) tout en étendant la plage utilisable ; l'un des deux ingrédients que YaRN combine avec une correction de température d'attention.
Attention thinning / lost-in-the-middle
La baisse de précision de récupération observée empiriquement pour des faits placés au milieu d'un très long prompt, même quand les mêmes faits près du début ou de la fin sont récupérés de façon fiable (Liu et al., 2023) ; la raison pour laquelle une grande fenêtre de contexte annoncée ne garantit pas un rappel uniforme sur toute son étendue.

Sources

  1. arXiv: YaRN — Efficient Context Window Extension of Large Language Models (Peng et al. 2023)
  2. arXiv: Ring Attention with Blockwise Transformers for Near-Infinite Context (Liu et al. 2023)
  3. arXiv: RoFormer — Enhanced Transformer with Rotary Position Embedding (Su et al. 2021)
  4. Anthropic Engineering — long-context internals
  5. arXiv — Shah et al., "FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision" (2024, fetched 2026-09-27)
  6. arXiv — Hsieh et al., "RULER: What's the Real Context Size of Your Long-Context Language Models?" (2024, fetched 2026-09-27)
  7. arXiv — Liu et al., "Lost in the Middle: How Language Models Use Long Contexts" (TACL 2023, fetched 2026-09-27)
  8. arXiv — Gemini Team, Google, "Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context" (2024, fetched 2026-09-27)
  9. Claude Docs — Context windows (current model context-window limits), fetched 2026-09-27
  10. SAP Help Portal — Orchestration service (document/DB grounding) in the generative AI hub, SAP AI Core (fetched 2026-09-27)
  11. SAP Community — Why SAP needs a Knowledge Graph: giving enterprise AI a map of the business (2026, fetched 2026-09-27)
  12. SAP News Center — SAP and Anthropic to bring Claude to the SAP Business AI Platform (2026-05-12)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →