Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Rotary Position Embeddings (RoPE) — warum Llama, Mistral und Claude sie nutzen

Rotary Position Embeddings (RoPE) — warum Llama, Mistral und Claude sie nutzen — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Rotary Position Embeddings (RoPE) — warum Llama, Mistral und Claude sie nutzen?

RoPE kodiert die Token-Position, indem es Q/K-Vektoren rotiert, sodass deren Skalarprodukt nur von der relativen Distanz (m minus n) abhängt, nicht vom absoluten Index — diese Eigenschaft erlaubte es Llama 3, ein mit 4.000 Tokens trainiertes Modell allein durch Neuskalierung der Basisfrequenz auf 128.000 oder 1 Million Tokens zu strecken.

Worum es geht

Rotary Position Embeddings (RoPE) lösen ein Problem, das jedes Transformer-basierte Modell irgendwie lösen muss: Woher weiß ein Modell, das Tokens über parallele, positionsunabhängige Attention-Operationen verarbeitet, dass „not" vor „good" die Bedeutung ändert, oder dass eine vierzigtausend Tokens zurückliegende Tatsache immer noch weiter entfernt ist als eine, die zweihundert Tokens zurückliegt? RoPE beantwortet dies, indem es die Query- und Key-Vektoren innerhalb jedes Attention-Heads um einen zur Token-Position proportionalen Winkel rotiert, statt wie frühere Transformer einen separaten Positionsvektor zum Token-Embedding zu addieren. RoPE wurde von Su et al. im RoFormer-Paper von 2021 eingeführt und ist seither die Standard-Positionscodierung für nahezu jedes seit 2023 veröffentlichte Open-Weight-Frontier-Modell geworden — die Llama-Familie, Mistrals dichte und Mixtral-Modelle, Falcon, Qwen, DeepSeek, Gemma 2 — und gilt, ausgehend von Anthropics öffentlicher System-Card-Sprache, als Einflussfaktor für Claudes eigene Architekturentscheidungen.

Warum es das gibt. Der ursprüngliche Transformer addierte sinusförmige Positionsvektoren zu den Token-Embeddings; Modelle der BERT-Ära lernten pro Slot ein absolutes Positions-Embedding. Beide Ansätze teilen zwei strukturelle Schwächen. Erstens können sie nicht extrapolieren: Ein Modell, das mit absoluten Positions-Embeddings für die Positionen null bis 4096 trainiert wurde, besitzt keine gelernte Repräsentation für Position 5000, sodass die Leistung jenseits der Trainings-Kontextlänge stark abfällt. Zweitens codieren sie die falsche Größe — Attention interessiert sich in der Praxis für die relative Distanz zwischen zwei Tokens, also wie weit zwei Wörter voneinander entfernt sind, nicht für ihren absoluten Index in der Sequenz, doch absolute Codierungen zwingen das Modell, die relative Distanz indirekt aus zwei absoluten Zahlen zu rekonstruieren.

Warum es zählt

  • Anders als additive sinusförmige oder gelernte absolute Embeddings verschafft RoPE der Attention implizite relative Position — genau das, was Attention tatsächlich braucht: wie weit Tokens voneinander entfernt sind, nicht ihren absoluten Index.
  • Techniken zur Kontexterweiterung (NTK-aware Scaling, YaRN, Position Interpolation) skalieren RoPEs Basisfrequenz neu — üblicherweise von 10.000 auf 500.000 oder höher —, um den Kontext mit minimalem zusätzlichem Fine-Tuning zu dehnen.
  • RoPE ist seit 2023 die De-facto-Wahl für nahezu jedes Open-Weight-LLM (Llama, Mistral, Falcon, Qwen, DeepSeek, Gemma 2) und die vermutete Wahl für Claude.

Kernpunkte

  • RoPE rotiert Q- und K-Vektoren um einen zur Position proportionalen Winkel; das resultierende Skalarprodukt hängt nur von der relativen Distanz (m − n) ab.
  • De-facto-Standard seit 2023 — Llama 1/2/3/4, Mistral, Mixtral, Falcon, Qwen, DeepSeek, Gemma 2 sowie die vermutete Claude-Familie.
  • Frequenzen θ_i = base^(-2i/d) nehmen entlang der Head-Dimension geometrisch ab; base = 10000 (Llama 2) oder 500000 (Llama 3 Long-Context).
  • Techniken zur Kontexterweiterung — Position Interpolation, NTK-aware Scaling, YaRN (Peng 2023), LongRoPE — dehnen ein mit 4K–8K trainiertes Modell mit minimalem Fine-Tuning auf 32K–1M.
  • Implizit relativ + extrapolierbar — die zwei Eigenschaften, die absoluten sinusförmigen und gelernten absoluten Positionscodierungen fehlen.
  • „Rotary Position Embeddings (RoPE) — warum Llama, Mistral und Claude sie nutzen" ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Steuerungsmodell, bevor Sie das Tool demonstrieren.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

RoPE-Basisfrequenz
Die Konstante θ_base in θ_i = base^(-2i/d), die die Wellenlängen der Positionsrotation steuert. Llama 2 verwendet 10000, Llama 3 Long-Context verwendet 500000. Das Dehnen dieser Konstante ist die Grundlage der Kontexterweiterung.
YaRN (Yet another RoPE extensioN method)
Eine 2023 vorgestellte Technik (Peng et al.), die NTK-aware Scaling mit einer Attention-Temperatur-Korrektur kombiniert, um RoPE-basierte Modelle mit wenigen hundert Fine-Tuning-Schritten auf das 4- bis 8-Fache ihrer Trainings-Kontextlänge zu erweitern.
Position Interpolation (PI)
Die einfachste RoPE-Erweiterung — Positionsindizes werden linear neu skaliert, sodass ein mit 4K trainiertes Modell 16K-Positionen behandelt, als wären sie 4K. Funktioniert, verschlechtert aber die Auflösung naher Tokens; YaRN und NTK-aware Scaling beheben dies.
ALiBi
Attention with Linear Biases — ein alternatives relatives Positionsschema, das in frühen Versionen von Falcon und BLOOM verwendet wurde. Bei neuen Modellveröffentlichungen weitgehend durch RoPE abgelöst, taucht aber noch in manchen Forschungsmodellen auf.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control Plane
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, Richtungssignale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Su et al. — RoFormer: Enhanced Transformer with Rotary Position Embedding (2021/2023 update)
  2. Peng et al. — YaRN: Efficient Context Window Extension of Large Language Models (2023)
  3. Meta Llama 3 Model Card — RoPE base 500000 and context-extension methodology
  4. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  5. SAP News Center — SAP Unveils the Autonomous Enterprise
  6. SAP News Center — The Future of the Enterprise Is Autonomous
  7. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  8. SAP Help Portal — Administering SAP Datasphere: Enable Joule for SAP Datasphere
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →