AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Speculative Decoding — Comment Claude / GPT-4 / Llama 3 atteignent un TTFT sous 100 ms

Speculative Decoding — Comment Claude / GPT-4 / Llama 3 atteignent un TTFT sous 100 ms — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Speculative Decoding ?

Le speculative decoding atteint un temps jusqu'au premier token sous 100 ms en faisant proposer plusieurs tokens par un petit modèle draft puis en les vérifiant tous avec le grand modèle cible en une seule passe parallèle — une accélération 2-4× avec une sortie mathématiquement identique à celle du modèle cible seul.

De quoi il s'agit

La génération autorégressive est séquentielle par définition — le token n+1 dépend du token n. Sur le matériel GPU moderne, cette dépendance séquentielle, et non les flops bruts, est le goulot : un modèle 70B prend ~30 ms par token quelle que soit la taille de batch parce que chaque étape attend des chargements mémoire, pas de l'arithmétique. Le speculative decoding brise la contrainte séquentielle en utilisant un petit modèle draft rapide pour proposer k tokens candidats, puis en vérifiant tous les k avec le grand modèle cible en un seul passage avant parallèle. Quand le modèle draft s'accorde avec la cible sur j des k tokens, le système avance de j+1 tokens (les j acceptés + une correction) par étape du modèle cible au lieu d'un seul — une accélération wall-clock 2-4× avec une sortie mathématiquement identique à la génération greedy du modèle cible.

Pourquoi c'est important

  • Le goulot d'un modèle 70B est le chargement mémoire, pas l'arithmétique — chaque token prend ~30 ms quelle que soit la taille de batch, exactement la contrainte que le speculative decoding attaque.
  • La probabilité d'acceptation min(1, q_i/p_i) garantit que la distribution de sortie échantillonnée est identique à la génération greedy du modèle cible — aucun compromis de qualité, seulement de vitesse.
  • Medusa et EAGLE suppriment le besoin d'un modèle draft séparé (têtes de prédiction légères ou prédiction au niveau feature), évitant la complexité de service à deux modèles de la recette originale.

Points clés

  • La génération séquentielle est bornée par la bande passante mémoire, pas par le calcul — le speculative decoding amortit un passage avant du grand modèle sur plusieurs tokens acceptés.
  • Recette canonique (Leviathan 2023) — petit modèle draft propose k tokens, modèle cible vérifie les k en un passage parallèle, accept-reject préserve exactement la distribution cible.
  • Variantes modernes — Medusa (têtes de prédiction légères sur la cible, pas de draft séparé) ; EAGLE (prédiction au niveau feature, ~3-4× d'accélération) ; Lookahead decoding (auto-vérification n-grams, aucun modèle draft).
  • Utilisateurs production — Claude d'Anthropic (TTFT sous 100 ms), stacks d'inférence Meta Llama 3 (vLLM/TensorRT-LLM), déploiements vLLM Mistral/DeepSeek.
  • La sortie est mathématiquement identique à la génération greedy/échantillonnée du modèle cible — le speculative decoding est une pure optimisation de latence, pas un compromis qualité.
  • Sur un point de terminaison managé du generative AI hub, le speculative decoding — comme le KV cache et le kernel d'attention — est invisible : c'est un choix d'implémentation du fournisseur d'hébergement, intégré au tarif par token, pas un levier que les clients SAP configurent directement.
  • Un déploiement BYOM auto-hébergé sur SAP AI Core (vLLM, selon le dépôt d'exemples propre de SAP) peut activer explicitement le speculative decoding avec un modèle frère plus petit comme draft — mais seulement si un petit modèle bien assorti, de même distribution, est réellement disponible et licencié pour le tenant.
  • Le plus grand risque pratique est un modèle draft mal assorti ou obsolète : dès que le draft et la cible divergent (typiquement après un ajustement de la cible non répercuté sur le draft), l'acceptation s'effondre vers zéro et la technique ajoute de la latence au lieu d'en retirer.

Termes employés sur cette page

Speculative decoding
Technique d'accélération de l'inférence où un petit modèle de brouillon rapide propose k tokens candidats qu'un grand modèle cible vérifie ensuite en une seule passe avant parallèle, atteignant une accélération de 2 à 4× en temps réel avec une distribution de sortie identique à celle d'un échantillonnage sur le seul modèle cible.
Draft model
Le petit modèle auxiliaire rapide du speculative decoding qui propose les tokens candidats ; typiquement 10 à 100× plus petit que le modèle cible et idéalement entraîné sur la même distribution de données afin de maximiser l'accord brouillon-cible.
Target model
Le grand modèle coûteux dont le speculative decoding préserve exactement la distribution de sortie ; il vérifie les k tokens candidats du brouillon en une seule passe avant parallèle.
Medusa
Variante du speculative decoding (Cai et al., 2024) qui ajoute des têtes de prédiction légères directement sur le modèle cible, éliminant le besoin d'un modèle de brouillon distinct et simplifiant le service d'inférence.
Time-to-first-token (TTFT)
La métrique de latence perçue par l'utilisateur pour l'inférence LLM — le temps réel entre la soumission d'un prompt et l'arrivée du premier token généré. Le speculative decoding est l'une des rares techniques à améliorer à la fois le TTFT et le débit en régime établi.

Sources

  1. Fast Inference from Transformers via Speculative Decoding (Leviathan et al., Google, 2023)
  2. Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads (Cai et al., 2024)
  3. EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty (Li et al., 2024)
  4. Anthropic engineering — Claude inference architecture commentary
  5. arXiv — Break the Sequential Dependency of LLM Inference Using Lookahead Decoding (Fu, Bailis, Stoica & Zhang, ICML 2024)
  6. GitHub hao-ai-lab — LookaheadDecoding official implementation
  7. GitHub vllm-project — vLLM (speculative decoding / draft-model serving configuration)
  8. GitHub NVIDIA — TensorRT-LLM (Medusa and draft-model speculative decoding support)
  9. SAP News Center — How SAP and NVIDIA Advance Enterprise AI Transformation (NIM inference optimisation, SAP-ABAP-1, 2026-03-17)
  10. GitHub SAP-samples — btp-generative-ai-hub-use-cases: bring-your-own OSS LLM on SAP AI Core (vLLM serving backend)
  11. SAP Help Portal — Choose a Resource Plan for training/inference in SAP AI Core (GPU sizing for a self-hosted draft+target deployment)
  12. Anthropic — Context windows documentation (Claude model family referenced for production sub-100ms TTFT claims)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →