Sliding Window Attention — Mistrals Trick für langen Kontext
Stand 2026-07-23
Was ist Sliding Window Attention — Mistrals Trick für langen Kontext?
Mistral 7B beansprucht einen effektiven Kontext von 32.000 Tokens, indem die Attention jedes Tokens auf ein Fenster von 4.000 Tokens beschränkt wird und sich das effektive rezeptive Feld über 32 gestapelte Schichten hinweg summiert, statt die O(n²)-Kosten voller Attention zu zahlen.
Worum es geht
Sliding Window Attention (SWA) beschränkt die Attention jedes Tokens auf ein festes Fenster naher Tokens — typischerweise 4K — statt auf die gesamte Sequenz zu achten. Durch das Stapeln vieler solcher Schichten breitet sich Information dennoch über große Distanzen aus (jede Schicht erweitert das effektive rezeptive Feld), doch die Kosten pro Schicht sinken von O(n²) auf O(n·w), wobei w die Fenstergröße ist. Die Architektur wurde durch die Forschung von Longformer (2020) und BigBird (2020) populär gemacht und von Mistral 7B (2023) in Produktionsmaßstab gebracht, das SWA mit einem rollierenden KV-Cache kombinierte, um 32K effektiven Kontext auf Hardware zu beanspruchen, die sich das zuvor nicht leisten konnte.
Warum es das gibt. Die quadratischen Kosten voller Attention dominieren GPU-Speicher und -Rechenleistung ab etwa 8K Tokens; FlashAttention (C214) hilft beim konstanten Faktor, nicht aber bei der Asymptotik. Für Anwendungen, bei denen die meisten relevanten Informationen innerhalb weniger tausend Tokens um eine gegebene Position liegen (lange Dokumente, Codebasen, mehrstufiger Chat), ist volle Attention verschwenderisch. SWA nutzt diese Lokalität direkt aus.
Warum es zählt
- Die Kosten pro Schicht sinken von O(n²) auf O(n·w), und ein rollierender KV-Cache lässt den Speicher pro Anfrage bei O(w) statt O(n) bleiben, indem Tokens außerhalb des Fensters verworfen werden.
- Ein 32-Schichten-Modell mit w=4096 erreicht rein durch das Stapeln von Sliding Windows ein theoretisches rezeptives Feld von rund 128K.
- Reines SWA kann Informationen verlieren, die mehr Sprünge benötigt hätten, als die Modelltiefe erlaubt — deshalb mischen Mistral Large und Mixtral 8x22B SWA mit periodischen Full-Attention-Schichten.
Kernpunkte
- Jedes Token beachtet nur die w vorangehenden Tokens (kausales Sliding Window) — O(n·w)-Kosten pro Schicht statt O(n²) bei voller Attention.
- Das effektive rezeptive Feld wächst über L gestapelte Schichten auf L · w; ein 32-Schichten-Mistral-7B (w=4096) erreicht ~128K theoretische Reichweite.
- Mistral 7B nutzt reines SWA-4096 + rollierenden KV-Cache — gedeckelter KV-Speicher pro Anfrage und beworbener 32K-Kontext.
- Mistral Large, Mixtral, Gemini 1.5 und Claude nutzen hybrides SWA + periodische Full-Attention-Schichten, um Genauigkeit über große Distanzen zurückzugewinnen.
- Vorläufer — Longformer (2020) und BigBird (2020) — etablierten das Muster in der Forschung; Mistral 7B (2023) war der Durchbruch in der Produktion.
- „Sliding Window Attention — Mistrals Trick für langen Kontext" ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Steuerungsmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Sliding Window Attention (SWA)
- Ein Attention-Muster, bei dem jedes Token nur die w nächsten vorangehenden Tokens beachtet, was die Kosten pro Schicht von O(n²) auf O(n·w) reduziert. Information breitet sich durch das Stapeln von Schichten über größere Distanzen aus.
- Rollierender KV-Cache
- Eine Inferenzzeit-Optimierung, die Key/Value-Einträge für Tokens außerhalb des aktuellen Sliding Windows verwirft und den KV-Speicher pro Anfrage unabhängig von der Gesamtsequenzlänge auf O(w) deckelt. Mistral 7Bs Signaturtrick.
- Effektives rezeptives Feld
- Die maximale Distanz, über die sich Information durch gestapelte SWA-Schichten vom Eingang zum Ausgang ausbreiten kann, gleich L · w für L Schichten mit Fenster w. Zu unterscheiden vom beworbenen „Kontextfenster".
- Hybride Attention
- Eine Architektur, die SWA-Schichten mit periodischen Full-Attention-Schichten verschachtelt (z. B. jede 4. oder jede 8. Schicht). Verwendet von Mistral Large, Mixtral, Gemini 1.5 und Claude, um die Genauigkeit über große Distanzen zurückzugewinnen, die reines SWA einbüßen kann.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Control Plane
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, Richtungssignale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Beltagy et al. — Longformer: The Long-Document Transformer (2020)
- Jiang et al. — Mistral 7B (2023) — Sliding Window Attention and Rolling Buffer Cache
- Mistral's Model Lets You Vibe Long-Running Code in the Cloud — AI Business, 2026-05-12
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.