Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Entraînement long-contexte — De 8K à plus d'un million de tokens

Entraînement long-contexte — De 8K à plus d'un million de tokens — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Entraînement long-contexte — De 8K à plus d'un million de tokens ?

Étendre le contexte de 8 K à plus d'1 M de tokens est trois problèmes d'ingénierie couplés, pas un seul — extrapolation de l'encodage de position (YaRN), coût d'attention en O(N²) (FlashAttention-3, Ring Attention), et construction de données d'entraînement qui enseigne le raisonnement, pas seulement la mémorisation.

L'entraînement en contexte long est l'effort d'ingénierie ponctuel qui consiste à prendre un modèle de langage construit et entraîné sur une longueur de contexte modeste — typiquement 8 000 ou 32 000 tokens — et à étendre sa fenêtre utilisable jusqu'aux plages de 200 000 à 2 millions de tokens que les modèles de pointe annoncent aujourd'hui. Ce n'est pas une astuce unique mais trois problèmes couplés qui doivent être résolus ensemble : comment l'information de position survit bien au-delà de sa plage d'entraînement, comment le calcul de l'attention reste praticable malgré son coût quadratique, et comment les données d'entraînement sont construites pour que le modèle apprenne réellement à raisonner sur de longues portées plutôt que de simplement les mémoriser.

L'encodage de position : le premier goulot d'étranglement

Pourquoi c'est important

  • L'extrapolation RoPE naïve se dégrade fortement au-delà de la longueur d'entraînement — YaRN (scaling NTK + correction de température d'attention) est le standard 2026 pour étendre un contexte de 8 K à 128 K+ en quelques centaines de pas de fine-tuning.
  • Ring Attention répartit la séquence sur plusieurs GPUs en topologie anneau, ce qui rend concrètement possible l'entraînement à 1 M+ tokens sur un cluster de 64 GPUs au lieu de nécessiter des pétaoctets de mémoire d'attention.
  • La concaténation aléatoire de documents pour les données d'entraînement produit un modèle qui mémorise les longues séquences mais ne peut pas raisonner dessus — un curriculum de données (textes longs, chaînes QA multi-documents) est ce qui construit réellement une capacité long-contexte utilisable.

Points clés

  • Trois composantes couplées — extrapolation de l'encodage de position (YaRN, NTK, PI), calcul de l'attention (FlashAttention-3, Ring Attention), curriculum des données.
  • Extension RoPE — YaRN est le standard 2026 ; étend un modèle de base 8 K à 128 K+ en quelques centaines de pas de fine-tuning avec perte qualité minimale.
  • Échelle de l'attention — auto-attention complète en O(N²) ; Ring Attention répartit la séquence sur plusieurs GPUs et fait tourner les blocs KV pour permettre l'entraînement 1 M+.
  • Curriculum données — synthèse de données long-contexte depuis livres, dépôts de code, QA multi-documents ; rampe 8 K → 32 K → 128 K pendant le fine-tuning.
  • Évaluation — benchmarks needle-in-haystack (NIAH) et RULER ; la précision long-contexte se dégrade de façon non-monotone — tester à chaque longueur prévue.

Termes employés sur cette page

RoPE (Rotary Position Embedding)
Schéma d'encodage de position qui fait pivoter les vecteurs de requête et de clé d'un angle proportionnel à leur position ; dominant dans les LLM de 2026 car il extrapole mieux que les encodages absolus ou sinusoïdaux.
YaRN
Yet another RoPE extensioN ; une technique introduite en 2023 combinant une mise à l'échelle des fréquences NTK-aware avec une correction de la température d'attention ; le standard 2026 pour étendre les fenêtres de contexte pré-entraînées de 16 à 32×.
Ring Attention
Algorithme d'attention distribuée (Liu et al. 2023) qui fragmente la séquence sur N GPU et fait tourner les blocs clé-valeur dans une topologie en anneau afin que chaque GPU voie le contexte complet au fil de N tours de communication ; permet l'entraînement sur plus d'un million de tokens.
Needle-in-Haystack (NIAH)
Évaluation de long contexte qui insère un fait cible à une position aléatoire dans un long document distracteur et mesure si le modèle le retrouve ; le contrôle de cohérence de base pour la capacité de long contexte.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
Evidence grade
Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. arXiv: YaRN — Efficient Context Window Extension of Large Language Models (Peng et al. 2023)
  2. arXiv: Ring Attention with Blockwise Transformers for Near-Infinite Context (Liu et al. 2023)
  3. arXiv: RoFormer — Enhanced Transformer with Rotary Position Embedding (Su et al. 2021)
  4. Anthropic Engineering — long-context internals
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →