Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen
Stand 2026-07-23
Was ist Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen?
Speculative Decoding erreicht eine Time-to-First-Token unter 100 ms, indem ein kleines Draft-Modell mehrere Tokens vorschlägt und diese in einem parallelen Durchgang vom großen Zielmodell verifiziert werden — eine 2- bis 4-fache Beschleunigung der realen Laufzeit bei einem Ergebnis, das mathematisch identisch mit dem alleinigen Lauf des Zielmodells ist.
Worum es geht
Autoregressive Generierung ist per Definition sequenziell — Token n+1 hängt von Token n ab. Auf moderner GPU-Hardware ist diese sequenzielle Abhängigkeit, nicht die rohe Rechenleistung, der Engpass: Ein 70B-Modell benötigt unabhängig von der Batch-Größe rund 30 ms pro Token, weil jeder Schritt auf Speicherzugriffe wartet, nicht auf Arithmetik. Speculative Decoding durchbricht die sequenzielle Beschränkung, indem ein kleines, schnelles Draft-Modell k Kandidaten-Tokens vorschlägt, die dann alle gemeinsam mit dem großen Zielmodell in einem einzigen parallelen Forward-Pass verifiziert werden. Stimmt das Draft-Modell mit dem Zielmodell bei j von k Tokens überein, rückt das System pro Zielmodell-Schritt j+1 Tokens vor (die j akzeptierten plus eine Korrektur) statt nur eines — eine 2- bis 4-fache Beschleunigung der Laufzeit bei einer Ausgabe, die mathematisch identisch mit der greedy Zielmodell-Generierung ist.
Warum es zählt
- Der Engpass beim 70B-Modell sind Speicherzugriffe, nicht Arithmetik — jedes Token benötigt unabhängig von der Batch-Größe rund 30 ms, genau die Beschränkung, die Speculative Decoding angreift.
- Die Akzeptanzwahrscheinlichkeit min(1, q_i/p_i) garantiert, dass die gesampelte Ausgabeverteilung identisch mit greedy Zielmodell-Generierung ist — kein Qualitätskompromiss, nur ein Geschwindigkeitsgewinn.
- Medusa und EAGLE machen ein separates Draft-Modell überflüssig (leichte Vorhersageköpfe oder Feature-Ebenen-Vorhersage stattdessen) und vermeiden so die Zwei-Modell-Serving-Komplexität des ursprünglichen Rezepts.
Kernpunkte
- Sequenzielle Generierung ist speicherbandbreitengebunden, nicht rechengebunden — Speculative Decoding amortisiert einen großen Modell-Forward-Pass über mehrere akzeptierte Tokens.
- Kanonisches Rezept (Leviathan 2023) — kleines Draft-Modell schlägt k Tokens vor, Zielmodell verifiziert alle k in einem parallelen Pass, Accept-Reject erhält die Zielverteilung exakt.
- Moderne Varianten — Medusa (leichte Vorhersageköpfe auf dem Zielmodell, kein separates Draft-Modell); EAGLE (Vorhersage auf Feature-Ebene, ~3-4× Beschleunigung); Lookahead (N-Gramm-Selbstverifikation, kein Draft-Modell).
- Produktivnutzer — Anthropic Claude (TTFT unter 100 ms), Meta-Llama-3-Inferenz-Stacks (vLLM/TensorRT-LLM), Mistral/DeepSeek-vLLM-Bereitstellungen.
- Die Ausgabe ist mathematisch identisch mit greedy/gesampelter Zielmodell-Generierung — Speculative Decoding ist eine reine Latenzoptimierung, kein Qualitätskompromiss.
- „Speculative Decoding — wie Claude, GPT-4 und Llama 3 eine TTFT unter 100 ms erreichen" ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Steuerungsmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Verantwortlichen, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Speculative Decoding
- Eine Technik zur Inferenzbeschleunigung, bei der ein kleines, schnelles Draft-Modell k Kandidaten-Tokens vorschlägt, die ein großes Zielmodell dann in einem einzigen parallelen Forward-Pass verifiziert, was eine 2- bis 4-fache Laufzeitbeschleunigung bei identischer Ausgabeverteilung wie reines Zielmodell-Sampling erzielt.
- Draft-Modell
- Das kleine, schnelle Hilfsmodell bei Speculative Decoding, das Kandidaten-Tokens vorschlägt; typischerweise 10- bis 100-mal kleiner als das Zielmodell und idealerweise auf derselben Datenverteilung trainiert, um die Draft-Ziel-Übereinstimmung zu maximieren.
- Zielmodell
- Das große, teure Modell, dessen Ausgabeverteilung Speculative Decoding exakt erhält; verifiziert die k Kandidaten-Tokens des Draft-Modells in einem parallelen Forward-Pass.
- Medusa
- Eine Speculative-Decoding-Variante (Cai et al., 2024), die leichte Vorhersageköpfe auf das Zielmodell selbst aufsetzt, wodurch ein separates Draft-Modell entfällt und das Serving vereinfacht wird.
- Time-to-First-Token (TTFT)
- Die für den Nutzer sichtbare Latenzkennzahl bei LLM-Inferenz — die Laufzeit zwischen dem Absenden eines Prompts und dem Eintreffen des ersten erzeugten Tokens. Speculative Decoding ist eine der wenigen Techniken, die sowohl TTFT als auch den Dauerdurchsatz verbessert.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Control Plane
- Die Schicht, die Policy, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Quellen
- Fast Inference from Transformers via Speculative Decoding (Leviathan et al., Google, 2023)
- Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads (Cai et al., 2024)
- EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty (Li et al., 2024)
- vLLM documentation — speculative decoding
- Anthropic engineering — Claude inference architecture commentary
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.