Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Speculative Decoding — Comment Claude / GPT-4 / Llama 3 atteignent un TTFT sous 100 ms

Speculative Decoding — Comment Claude / GPT-4 / Llama 3 atteignent un TTFT sous 100 ms — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que Speculative Decoding — Comment Claude / GPT-4 / Llama 3 atteignent un TTFT sous 100 ms ?

Le speculative decoding atteint un temps jusqu'au premier token sous 100 ms en faisant proposer plusieurs tokens par un petit modèle draft puis en les vérifiant tous avec le grand modèle cible en une seule passe parallèle — une accélération 2-4× avec une sortie mathématiquement identique à celle du modèle cible seul.

De quoi il s'agit

La génération autorégressive est séquentielle par définition — le token n+1 dépend du token n. Sur le matériel GPU moderne, cette dépendance séquentielle, et non les flops bruts, est le goulot : un modèle 70B prend ~30 ms par token quelle que soit la taille de batch parce que chaque étape attend des chargements mémoire, pas de l'arithmétique. Le speculative decoding brise la contrainte séquentielle en utilisant un petit modèle draft rapide pour proposer k tokens candidats, puis en vérifiant tous les k avec le grand modèle cible en un seul passage avant parallèle. Quand le modèle draft s'accorde avec la cible sur j des k tokens, le système avance de j+1 tokens (les j acceptés + une correction) par étape du modèle cible au lieu d'un seul — une accélération wall-clock 2-4× avec une sortie mathématiquement identique à la génération greedy du modèle cible.

Pourquoi c'est important

  • Le goulot d'un modèle 70B est le chargement mémoire, pas l'arithmétique — chaque token prend ~30 ms quelle que soit la taille de batch, exactement la contrainte que le speculative decoding attaque.
  • La probabilité d'acceptation min(1, q_i/p_i) garantit que la distribution de sortie échantillonnée est identique à la génération greedy du modèle cible — aucun compromis de qualité, seulement de vitesse.
  • Medusa et EAGLE suppriment le besoin d'un modèle draft séparé (têtes de prédiction légères ou prédiction au niveau feature), évitant la complexité de service à deux modèles de la recette originale.

Points clés

  • La génération séquentielle est bornée par la bande passante mémoire, pas par le calcul — le speculative decoding amortit un passage avant du grand modèle sur plusieurs tokens acceptés.
  • Recette canonique (Leviathan 2023) — petit modèle draft propose k tokens, modèle cible vérifie les k en un passage parallèle, accept-reject préserve exactement la distribution cible.
  • Variantes modernes — Medusa (têtes de prédiction légères sur la cible, pas de draft séparé) ; EAGLE (prédiction au niveau feature, ~3-4× d'accélération) ; Lookahead (auto-vérification n-grams, pas de modèle draft).
  • Utilisateurs production — Claude d'Anthropic (TTFT sous 100 ms), stacks d'inférence Meta Llama 3 (vLLM/TensorRT-LLM), déploiements vLLM Mistral/DeepSeek.
  • La sortie est mathématiquement identique à la génération greedy/échantillonnée du modèle cible — le speculative decoding est une pure optimisation de latence, pas un compromis qualité.

Termes employés sur cette page

Speculative decoding
Technique d'accélération de l'inférence où un petit modèle de brouillon rapide propose k tokens candidats qu'un grand modèle cible vérifie ensuite en une seule passe avant parallèle, atteignant une accélération de 2 à 4× en temps réel avec une distribution de sortie identique à celle d'un échantillonnage sur le seul modèle cible.
Draft model
Le petit modèle auxiliaire rapide du speculative decoding qui propose les tokens candidats ; typiquement 10 à 100× plus petit que le modèle cible et idéalement entraîné sur la même distribution de données afin de maximiser l'accord brouillon-cible.
Target model
Le grand modèle coûteux dont le speculative decoding préserve exactement la distribution de sortie ; il vérifie les k tokens candidats du brouillon en une seule passe avant parallèle.
Medusa
Variante du speculative decoding (Cai et al., 2024) qui ajoute des têtes de prédiction légères directement sur le modèle cible, éliminant le besoin d'un modèle de brouillon distinct et simplifiant le service d'inférence.
Time-to-first-token (TTFT)
La métrique de latence perçue par l'utilisateur pour l'inférence LLM — le temps réel entre la soumission d'un prompt et l'arrivée du premier token généré. Le speculative decoding est l'une des rares techniques à améliorer à la fois le TTFT et le débit en régime établi.
Decision owner
La personne responsable qui assume l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, métriques, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique la politique, l'accès, la traçabilité, la supervision et l'escalade à travers le modèle opérationnel.

Sources

  1. Fast Inference from Transformers via Speculative Decoding (Leviathan et al., Google, 2023)
  2. Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads (Cai et al., 2024)
  3. EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty (Li et al., 2024)
  4. vLLM documentation — speculative decoding
  5. Anthropic engineering — Claude inference architecture commentary
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →