Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen

Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen?

Speculative Decoding erreicht eine Time-to-First-Token unter 100 ms, indem ein kleines Draft-Modell mehrere Tokens vorschlägt und diese in einem parallelen Durchgang vom großen Zielmodell verifiziert werden — eine 2- bis 4-fache Beschleunigung der realen Laufzeit bei einem Ergebnis, das mathematisch identisch mit dem alleinigen Lauf des Zielmodells ist.

Worum es geht

Autoregressive Generierung ist per Definition sequenziell — Token n+1 hängt von Token n ab. Auf moderner GPU-Hardware ist diese sequenzielle Abhängigkeit, nicht die rohe Rechenleistung, der Engpass: Ein 70B-Modell benötigt unabhängig von der Batch-Größe rund 30 ms pro Token, weil jeder Schritt auf Speicherzugriffe wartet, nicht auf Arithmetik. Speculative Decoding durchbricht die sequenzielle Beschränkung, indem ein kleines, schnelles Draft-Modell k Kandidaten-Tokens vorschlägt, die dann alle gemeinsam mit dem großen Zielmodell in einem einzigen parallelen Forward-Pass verifiziert werden. Stimmt das Draft-Modell mit dem Zielmodell bei j von k Tokens überein, rückt das System pro Zielmodell-Schritt j+1 Tokens vor (die j akzeptierten plus eine Korrektur) statt nur eines — eine 2- bis 4-fache Beschleunigung der Laufzeit bei einer Ausgabe, die mathematisch identisch mit der greedy Zielmodell-Generierung ist.

Warum es zählt

  • Der Engpass beim 70B-Modell sind Speicherzugriffe, nicht Arithmetik — jedes Token benötigt unabhängig von der Batch-Größe rund 30 ms, genau die Beschränkung, die Speculative Decoding angreift.
  • Die Akzeptanzwahrscheinlichkeit min(1, q_i/p_i) garantiert, dass die gesampelte Ausgabeverteilung identisch mit greedy Zielmodell-Generierung ist — kein Qualitätskompromiss, nur ein Geschwindigkeitsgewinn.
  • Medusa und EAGLE machen ein separates Draft-Modell überflüssig (leichte Vorhersageköpfe oder Feature-Ebenen-Vorhersage stattdessen) und vermeiden so die Zwei-Modell-Serving-Komplexität des ursprünglichen Rezepts.

Kernpunkte

  • Sequenzielle Generierung ist speicherbandbreitengebunden, nicht rechengebunden — Speculative Decoding amortisiert einen großen Modell-Forward-Pass über mehrere akzeptierte Tokens.
  • Kanonisches Rezept (Leviathan 2023) — kleines Draft-Modell schlägt k Tokens vor, Zielmodell verifiziert alle k in einem parallelen Pass, Accept-Reject erhält die Zielverteilung exakt.
  • Moderne Varianten — Medusa (leichte Vorhersageköpfe auf dem Zielmodell, kein separates Draft-Modell); EAGLE (Vorhersage auf Feature-Ebene, ~3-4× Beschleunigung); Lookahead (N-Gramm-Selbstverifikation, kein Draft-Modell).
  • Produktivnutzer — Anthropic Claude (TTFT unter 100 ms), Meta-Llama-3-Inferenz-Stacks (vLLM/TensorRT-LLM), Mistral/DeepSeek-vLLM-Bereitstellungen.
  • Die Ausgabe ist mathematisch identisch mit greedy/gesampelter Zielmodell-Generierung — Speculative Decoding ist eine reine Latenzoptimierung, kein Qualitätskompromiss.
  • „Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen" ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Steuerungsmodell, bevor Sie das Tool demonstrieren.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Speculative Decoding
Eine Technik zur Inferenzbeschleunigung, bei der ein kleines, schnelles Draft-Modell k Kandidaten-Tokens vorschlägt, die ein großes Zielmodell dann in einem einzigen parallelen Forward-Pass verifiziert, was eine 2- bis 4-fache Laufzeitbeschleunigung bei identischer Ausgabeverteilung wie reines Zielmodell-Sampling erzielt.
Draft-Modell
Das kleine, schnelle Hilfsmodell bei Speculative Decoding, das Kandidaten-Tokens vorschlägt; typischerweise 10- bis 100-mal kleiner als das Zielmodell und idealerweise auf derselben Datenverteilung trainiert, um die Draft-Ziel-Übereinstimmung zu maximieren.
Zielmodell
Das große, teure Modell, dessen Ausgabeverteilung Speculative Decoding exakt erhält; verifiziert die k Kandidaten-Tokens des Draft-Modells in einem parallelen Forward-Pass.
Medusa
Eine Speculative-Decoding-Variante (Cai et al., 2024), die leichte Vorhersageköpfe auf das Zielmodell selbst aufsetzt, wodurch ein separates Draft-Modell entfällt und das Serving vereinfacht wird.
Time-to-First-Token (TTFT)
Die für den Nutzer sichtbare Latenzkennzahl bei LLM-Inferenz — die Laufzeit zwischen dem Absenden eines Prompts und dem Eintreffen des ersten erzeugten Tokens. Speculative Decoding ist eine der wenigen Techniken, die sowohl TTFT als auch den Dauerdurchsatz verbessert.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control Plane
Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.

Quellen

  1. Fast Inference from Transformers via Speculative Decoding (Leviathan et al., Google, 2023)
  2. Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads (Cai et al., 2024)
  3. EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty (Li et al., 2024)
  4. vLLM documentation — speculative decoding
  5. Anthropic engineering — Claude inference architecture commentary
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →