Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Compromis Latence vs Débit — TTFT, TPOT, Conception du SLA

Compromis Latence vs Débit — TTFT, TPOT, Conception du SLA — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que Compromis Latence vs Débit — TTFT, TPOT, Conception du SLA ?

Chat, complétion de code, traitement batch et agents vocaux ont chacun besoin d'une cible TTFT/TPOT différente — mélanger un endpoint chat sensible à la latence avec un job batch gourmand en débit sur un seul endpoint garantit que le job batch plombe le p99 du chat au premier pic de trafic.

De quoi il s'agit

Le service LLM a trois métriques de performance orthogonales qu'un SLA doit traiter séparément. Le Time-To-First-Token (TTFT) mesure l'attente entre la soumission de la requête et le premier token émis — dominé par la phase prefill, dans laquelle le modèle traite le prompt complet en une seule passe parallèle. Le Time-Per-Output-Token (TPOT, aussi appelé inter-token latency, ITL) mesure l'écart entre les tokens émis successifs — dominé par la phase décodage, dans laquelle le modèle génère un token par passe avant. La latence de bout en bout vaut TTFT + (tokens sortie × TPOT). Le débit (tokens/s agrégé sur les requêtes concurrentes) est le chiffre de capacité système.

Pourquoi c'est important

  • Des batches continus plus grands élèvent le débit mais aussi le TTFT (les nouvelles requêtes attendent le prochain tick d'ordonnancement) et le TPOT (plus de requêtes partagent la même horloge GPU par token) — le compromis ne peut pas être éliminé, seulement réduit.
  • Les cibles SLA concrètes diffèrent par workload : le chat vise un p95 TTFT sous 500 ms, la complétion de code sous 200 ms, le résumé batch ignore le TTFT pour maximiser la taille de batch, les agents vocaux visent un TPOT sous 100 ms mais tolèrent 500-800 ms de TTFT.
  • Le geste de conception de l'architecte est de scinder les workloads en paliers d'endpoint distincts pointant vers le même fichier de modèle — un endpoint petit-batch basse latence, un endpoint grand-batch haut débit.

Points clés

  • Trois métriques orthogonales : TTFT (limité par prefill), TPOT/ITL (limité par décodage), débit (tokens/s système agrégé sur requêtes concurrentes).
  • Latence de bout en bout = TTFT + (tokens_sortie × TPOT) — les deux doivent figurer dans tout SLA LLM.
  • Le continuous batching élève le débit mais élève le TTFT (les requêtes attendent le prochain tick) et le TPOT (les requêtes partagent l'horloge) ; la paged attention réduit sans éliminer le compromis.
  • Cible chat : p95 TTFT < 500 ms, TPOT 30-50 ms. Complétion code : TTFT < 200 ms. Jobs batch : débit d'abord, TTFT non pertinent. Agents vocaux : TPOT < 100 ms.
  • Scindez les workloads par paliers d'endpoint — basse latence + petit batch pour chat, haut débit + grand batch pour hors-ligne ; ne mélangez jamais sur un endpoint.
  • Mesurez en p50/p95/p99 — les moyennes masquent la latence longue traîne qui tue l'expérience utilisateur.

Termes employés sur cette page

TTFT
Time-To-First-Token — le temps entre la soumission de la requête et le premier token émis ; borné par le calcul de préremplissage (prefill) sur l'ensemble du prompt d'entrée.
TPOT / ITL
Time-Per-Output-Token ou Inter-Token Latency — le temps entre tokens émis successifs pendant le décodage ; borné par la bande passante mémoire lors de la génération autorégressive.
Continuous batching
Technique de service où de nouvelles requêtes rejoignent un lot en cours à chaque étape de décodage, au lieu d'attendre l'achèvement du lot ; standard dans vLLM, TensorRT-LLM, SGLang.
Paged attention
Technique de gestion mémoire empruntée à la mémoire virtuelle ; le KV-cache est stocké en pages de taille fixe pour réduire la fragmentation lors du service de séquences de longueur variable.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, métriques, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique la politique, les accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. NVIDIA — TensorRT-LLM Best Practices
  2. vLLM — Continuous Batching and Paged Attention
  3. MLPerf Inference — Latency Metrics Specification
  4. Anyscale — LLM Serving Performance Deep Dive
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP HANA Platform — Help Portal
  10. SAP Datasphere — Help Portal
  11. SAP Datasphere — official product page
  12. SAP Analytics Cloud — Help Portal
  13. SAP Analytics Cloud — official product page
  14. SAP BW/4HANA — Help Portal
  15. SAP S/4HANA — Help Portal
  16. SAP News Center
  17. SAP Community
  18. SAP — industries overview
  19. Gartner — research & analyst site
  20. BARC — BI & Analytics research
  21. TDWI — data & analytics research
  22. DSAG — German-speaking SAP user group
  23. ASUG — Americas' SAP User Group
  24. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →