Entraînement long-contexte — De 8K à plus d'un million de tokens
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Entraînement long-contexte — De 8K à plus d'un million de tokens ?
Étendre le contexte de 8 K à plus d'1 M de tokens est trois problèmes d'ingénierie couplés, pas un seul — extrapolation de l'encodage de position (YaRN), coût d'attention en O(N²) (FlashAttention-3, Ring Attention), et construction de données d'entraînement qui enseigne le raisonnement, pas seulement la mémorisation.
L'entraînement en contexte long est l'effort d'ingénierie ponctuel qui consiste à prendre un modèle de langage construit et entraîné sur une longueur de contexte modeste — typiquement 8 000 ou 32 000 tokens — et à étendre sa fenêtre utilisable jusqu'aux plages de 200 000 à 2 millions de tokens que les modèles de pointe annoncent aujourd'hui. Ce n'est pas une astuce unique mais trois problèmes couplés qui doivent être résolus ensemble : comment l'information de position survit bien au-delà de sa plage d'entraînement, comment le calcul de l'attention reste praticable malgré son coût quadratique, et comment les données d'entraînement sont construites pour que le modèle apprenne réellement à raisonner sur de longues portées plutôt que de simplement les mémoriser.
L'encodage de position : le premier goulot d'étranglement
Pourquoi c'est important
- L'extrapolation RoPE naïve se dégrade fortement au-delà de la longueur d'entraînement — YaRN (scaling NTK + correction de température d'attention) est le standard 2026 pour étendre un contexte de 8 K à 128 K+ en quelques centaines de pas de fine-tuning.
- Ring Attention répartit la séquence sur plusieurs GPUs en topologie anneau, ce qui rend concrètement possible l'entraînement à 1 M+ tokens sur un cluster de 64 GPUs au lieu de nécessiter des pétaoctets de mémoire d'attention.
- La concaténation aléatoire de documents pour les données d'entraînement produit un modèle qui mémorise les longues séquences mais ne peut pas raisonner dessus — un curriculum de données (textes longs, chaînes QA multi-documents) est ce qui construit réellement une capacité long-contexte utilisable.
Points clés
- Trois composantes couplées — extrapolation de l'encodage de position (YaRN, NTK, PI), calcul de l'attention (FlashAttention-3, Ring Attention), curriculum des données.
- Extension RoPE — YaRN est le standard 2026 ; étend un modèle de base 8 K à 128 K+ en quelques centaines de pas de fine-tuning avec perte qualité minimale.
- Échelle de l'attention — auto-attention complète en O(N²) ; Ring Attention répartit la séquence sur plusieurs GPUs et fait tourner les blocs KV pour permettre l'entraînement 1 M+.
- Curriculum données — synthèse de données long-contexte depuis livres, dépôts de code, QA multi-documents ; rampe 8 K → 32 K → 128 K pendant le fine-tuning.
- Évaluation — benchmarks needle-in-haystack (NIAH) et RULER ; la précision long-contexte se dégrade de façon non-monotone — tester à chaque longueur prévue.
Termes employés sur cette page
- RoPE (Rotary Position Embedding)
- Schéma d'encodage de position qui fait pivoter les vecteurs de requête et de clé d'un angle proportionnel à leur position ; dominant dans les LLM de 2026 car il extrapole mieux que les encodages absolus ou sinusoïdaux.
- YaRN
- Yet another RoPE extensioN ; une technique introduite en 2023 combinant une mise à l'échelle des fréquences NTK-aware avec une correction de la température d'attention ; le standard 2026 pour étendre les fenêtres de contexte pré-entraînées de 16 à 32×.
- Ring Attention
- Algorithme d'attention distribuée (Liu et al. 2023) qui fragmente la séquence sur N GPU et fait tourner les blocs clé-valeur dans une topologie en anneau afin que chaque GPU voie le contexte complet au fil de N tours de communication ; permet l'entraînement sur plus d'un million de tokens.
- Needle-in-Haystack (NIAH)
- Évaluation de long contexte qui insère un fait cible à une position aléatoire dans un long document distracteur et mesure si le modèle le retrouve ; le contrôle de cohérence de base pour la capacité de long contexte.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
- Evidence grade
- Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- arXiv: YaRN — Efficient Context Window Extension of Large Language Models (Peng et al. 2023)
- arXiv: Ring Attention with Blockwise Transformers for Near-Infinite Context (Liu et al. 2023)
- arXiv: RoFormer — Enhanced Transformer with Rotary Position Embedding (Su et al. 2021)
- Anthropic Engineering — long-context internals
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.