Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Training für langen Kontext — von 8.000 auf über 1 Million Tokens

Training für langen Kontext — von 8.000 auf über 1 Million Tokens — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Training für langen Kontext — von 8.000 auf über 1 Million Tokens?

Die Erweiterung des Kontexts von 8.000 auf über 1 Million Tokens sind drei miteinander verknüpfte technische Probleme, nicht eines — die Extrapolation der Positionskodierung (YaRN), die O(N²)-Kosten der Attention (FlashAttention-3, Ring Attention) und der Aufbau von Trainingsdaten, die Reasoning statt bloßes Auswendiglernen vermitteln.

Long-Context-Training ist die eigenständige Ingenieursarbeit, die ein Sprachmodell, das mit einer bescheidenen Kontextlänge gebaut und trainiert wurde — typischerweise 8.000 oder 32.000 Tokens —, auf die Fenster von 200.000 bis 2 Millionen Tokens erweitert, die Frontier-Modelle heute bewerben. Es ist kein einzelner Trick, sondern drei miteinander gekoppelte Probleme, die gemeinsam gelöst werden müssen: wie Positionsinformation weit über den Trainingsbereich hinaus erhalten bleibt, wie die Attention-Berechnung bei quadratischen Kosten handhabbar bleibt, und wie Trainingsdaten so konstruiert werden, dass das Modell tatsächlich lernt, über lange Spannen hinweg zu schlussfolgern, statt sie bloß auswendig zu lernen.

Positionskodierung: der erste Engpass

Rotary Position Embeddings, das dominierende Schema in modernen Decoder-only-Modellen, kodieren Position, indem sie Query- und Key-Vektoren um einen zur Token-Position proportionalen Winkel rotieren, bevor das Attention-Skalarprodukt berechnet wird. Die Rotationsfrequenz legt den Bereich fest, über den Positionsinformation kohärent bleibt, und ein naives Betreiben eines RoPE-basierten Modells über seine Trainingslänge hinaus verschlechtert die Ausgabequalität stark, weil das Modell in Rotationswinkel extrapoliert, die es während des Trainings nie gesehen hat. Drei Techniken adressieren dies. Position Interpolation komprimiert den Positionsindex, sodass eine längere Sequenz zurück in den Frequenzbereich abgebildet wird, für den das Modell trainiert wurde. NTK-aware Scaling passt die Rotationsbasis an, um die hochfrequenten Komponenten zu erhalten, die feingranulare Positionsdetails tragen. YaRN kombiniert NTK-artige Skalierung mit einer Temperaturkorrektur der Attention selbst und ist zum 2026er-Standardrezept geworden, um ein 8.000-Token-Basismodell mit nur wenigen Hundert Fine-Tuning-Schritten statt einem vollständigen Retraining auf 128.000 Tokens und darüber hinaus zu strecken.

Warum es zählt

  • Naive RoPE-Extrapolation verschlechtert sich stark über die Trainingslänge hinaus — YaRN (NTK-Skalierung + Attention-Temperaturkorrektur) ist der 2026er-Standard, um ein 8K-Basismodell in wenigen Hundert Fine-Tuning-Schritten auf 128K+ zu strecken.
  • Ring Attention teilt die Sequenz in einer Ring-Topologie über GPUs auf, was konkret der Grund ist, warum Training mit 1M+ Kontext auf einem 64-GPU-Cluster handhabbar wird, statt Petabytes an Attention-Speicher zu erfordern.
  • Zufälliges Aneinanderhängen von Dokumenten für Trainingsdaten erzeugt ein Modell, das lange Sequenzen auswendig lernt, aber nicht über sie schlussfolgern kann — Curriculum-Daten (buchlange Texte, mehrdokumentige QA-Ketten) sind es, was tatsächlich nutzbare Long-Context-Fähigkeit aufbaut.

Kernpunkte

  • Drei gekoppelte Komponenten — Extrapolation der Positionskodierung (YaRN, NTK, PI), Attention-Berechnung (FlashAttention-3, Ring Attention), Trainingsdaten-Curriculum.
  • RoPE-Erweiterung — YaRN ist der 2026er-Standard; bringt ein 8K-Basismodell mit wenigen Hundert Fine-Tuning-Schritten bei minimalem Qualitätsverlust auf 128K+.
  • Attention-Skalierung — volle Self-Attention ist O(N²); Ring Attention teilt die Sequenz über GPUs auf und rotiert KV-Blöcke, um Training mit 1M+ Kontext zu ermöglichen.
  • Daten-Curriculum — Long-Context-Trainingsdaten aus buchlangen Texten, Code-Repositories, mehrdokumentiger QA synthetisieren; in der Fine-Tuning-Phase 8K → 32K → 128K steigern.
  • Evaluation — Needle-in-Haystack (NIAH) und RULER-Benchmarks; die Long-Context-Genauigkeit verschlechtert sich nicht-monoton — bei jeder geplanten Kontextlänge testen.
  • Long-Context Training — From 8K to 1M+ Tokens ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

RoPE (Rotary Position Embedding)
Positionskodierungsschema, das Query- und Key-Vektoren um einen zu ihrer Position proportionalen Winkel rotiert; dominiert 2026er-LLMs, weil es besser extrapoliert als absolute oder sinusoidale Kodierungen.
YaRN
Yet another RoPE extensioN; eine 2023 eingeführte Technik, die NTK-bewusste Frequenzskalierung mit Attention-Temperaturkorrektur kombiniert; der 2026er-Standard, um vortrainierte Kontextfenster um das 16- bis 32-Fache zu erweitern.
Ring Attention
Verteilter Attention-Algorithmus (Liu et al. 2023), der die Sequenz über N GPUs aufteilt und Key-Value-Blöcke in einer Ring-Topologie rotiert, sodass jede GPU über N Kommunikationsrunden den vollständigen Kontext sieht; ermöglicht Training mit 1M+ Tokens.
Needle-in-Haystack (NIAH)
Long-Context-Evaluation, die eine Zielfakt an einer zufälligen Position in einem langen Ablenkungsdokument platziert und misst, ob das Modell sie abruft; die grundlegende Plausibilitätsprüfung für Long-Context-Fähigkeit.
Decision owner
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantic contract
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control plane
Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidence grade
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. arXiv: YaRN — Efficient Context Window Extension of Large Language Models (Peng et al. 2023)
  2. arXiv: Ring Attention with Blockwise Transformers for Near-Infinite Context (Liu et al. 2023)
  3. arXiv: RoFormer — Enhanced Transformer with Rotary Position Embedding (Su et al. 2021)
  4. Anthropic Engineering — long-context internals
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →