Training für langen Kontext — von 8.000 auf über 1 Million Tokens
Stand 2026-07-24T14:00:00Z
Was ist Training für langen Kontext — von 8.000 auf über 1 Million Tokens?
Die Erweiterung des Kontexts von 8.000 auf über 1 Million Tokens sind drei miteinander verknüpfte technische Probleme, nicht eines — die Extrapolation der Positionskodierung (YaRN), die O(N²)-Kosten der Attention (FlashAttention-3, Ring Attention) und der Aufbau von Trainingsdaten, die Reasoning statt bloßes Auswendiglernen vermitteln.
Long-Context-Training ist die eigenständige Ingenieursarbeit, die ein Sprachmodell, das mit einer bescheidenen Kontextlänge gebaut und trainiert wurde — typischerweise 8.000 oder 32.000 Tokens —, auf die Fenster von 200.000 bis 2 Millionen Tokens erweitert, die Frontier-Modelle heute bewerben. Es ist kein einzelner Trick, sondern drei miteinander gekoppelte Probleme, die gemeinsam gelöst werden müssen: wie Positionsinformation weit über den Trainingsbereich hinaus erhalten bleibt, wie die Attention-Berechnung bei quadratischen Kosten handhabbar bleibt, und wie Trainingsdaten so konstruiert werden, dass das Modell tatsächlich lernt, über lange Spannen hinweg zu schlussfolgern, statt sie bloß auswendig zu lernen.
Positionskodierung: der erste Engpass
Rotary Position Embeddings, das dominierende Schema in modernen Decoder-only-Modellen, kodieren Position, indem sie Query- und Key-Vektoren um einen zur Token-Position proportionalen Winkel rotieren, bevor das Attention-Skalarprodukt berechnet wird. Die Rotationsfrequenz legt den Bereich fest, über den Positionsinformation kohärent bleibt, und ein naives Betreiben eines RoPE-basierten Modells über seine Trainingslänge hinaus verschlechtert die Ausgabequalität stark, weil das Modell in Rotationswinkel extrapoliert, die es während des Trainings nie gesehen hat. Drei Techniken adressieren dies. Position Interpolation komprimiert den Positionsindex, sodass eine längere Sequenz zurück in den Frequenzbereich abgebildet wird, für den das Modell trainiert wurde. NTK-aware Scaling passt die Rotationsbasis an, um die hochfrequenten Komponenten zu erhalten, die feingranulare Positionsdetails tragen. YaRN kombiniert NTK-artige Skalierung mit einer Temperaturkorrektur der Attention selbst und ist zum 2026er-Standardrezept geworden, um ein 8.000-Token-Basismodell mit nur wenigen Hundert Fine-Tuning-Schritten statt einem vollständigen Retraining auf 128.000 Tokens und darüber hinaus zu strecken.
Warum es zählt
- Naive RoPE-Extrapolation verschlechtert sich stark über die Trainingslänge hinaus — YaRN (NTK-Skalierung + Attention-Temperaturkorrektur) ist der 2026er-Standard, um ein 8K-Basismodell in wenigen Hundert Fine-Tuning-Schritten auf 128K+ zu strecken.
- Ring Attention teilt die Sequenz in einer Ring-Topologie über GPUs auf, was konkret der Grund ist, warum Training mit 1M+ Kontext auf einem 64-GPU-Cluster handhabbar wird, statt Petabytes an Attention-Speicher zu erfordern.
- Zufälliges Aneinanderhängen von Dokumenten für Trainingsdaten erzeugt ein Modell, das lange Sequenzen auswendig lernt, aber nicht über sie schlussfolgern kann — Curriculum-Daten (buchlange Texte, mehrdokumentige QA-Ketten) sind es, was tatsächlich nutzbare Long-Context-Fähigkeit aufbaut.
Kernpunkte
- Drei gekoppelte Komponenten — Extrapolation der Positionskodierung (YaRN, NTK, PI), Attention-Berechnung (FlashAttention-3, Ring Attention), Trainingsdaten-Curriculum.
- RoPE-Erweiterung — YaRN ist der 2026er-Standard; bringt ein 8K-Basismodell mit wenigen Hundert Fine-Tuning-Schritten bei minimalem Qualitätsverlust auf 128K+.
- Attention-Skalierung — volle Self-Attention ist O(N²); Ring Attention teilt die Sequenz über GPUs auf und rotiert KV-Blöcke, um Training mit 1M+ Kontext zu ermöglichen.
- Daten-Curriculum — Long-Context-Trainingsdaten aus buchlangen Texten, Code-Repositories, mehrdokumentiger QA synthetisieren; in der Fine-Tuning-Phase 8K → 32K → 128K steigern.
- Evaluation — Needle-in-Haystack (NIAH) und RULER-Benchmarks; die Long-Context-Genauigkeit verschlechtert sich nicht-monoton — bei jeder geplanten Kontextlänge testen.
- Long-Context Training — From 8K to 1M+ Tokens ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- RoPE (Rotary Position Embedding)
- Positionskodierungsschema, das Query- und Key-Vektoren um einen zu ihrer Position proportionalen Winkel rotiert; dominiert 2026er-LLMs, weil es besser extrapoliert als absolute oder sinusoidale Kodierungen.
- YaRN
- Yet another RoPE extensioN; eine 2023 eingeführte Technik, die NTK-bewusste Frequenzskalierung mit Attention-Temperaturkorrektur kombiniert; der 2026er-Standard, um vortrainierte Kontextfenster um das 16- bis 32-Fache zu erweitern.
- Ring Attention
- Verteilter Attention-Algorithmus (Liu et al. 2023), der die Sequenz über N GPUs aufteilt und Key-Value-Blöcke in einer Ring-Topologie rotiert, sodass jede GPU über N Kommunikationsrunden den vollständigen Kontext sieht; ermöglicht Training mit 1M+ Tokens.
- Needle-in-Haystack (NIAH)
- Long-Context-Evaluation, die eine Zielfakt an einer zufälligen Position in einem langen Ablenkungsdokument platziert und misst, ob das Modell sie abruft; die grundlegende Plausibilitätsprüfung für Long-Context-Fähigkeit.
- Decision owner
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantic contract
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Control plane
- Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidence grade
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- arXiv: YaRN — Efficient Context Window Extension of Large Language Models (Peng et al. 2023)
- arXiv: Ring Attention with Blockwise Transformers for Near-Infinite Context (Liu et al. 2023)
- arXiv: RoFormer — Enhanced Transformer with Rotary Position Embedding (Su et al. 2021)
- Anthropic Engineering — long-context internals
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.