Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Économie de l'inférence — Coût, latence, quantisation, distillation

Économie de l'inférence — Coût, latence, quantisation, distillation — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que Économie de l'inférence — Coût, latence, quantisation, distillation ?

À 200K sessions Joule quotidiennes, une réduction de 10 % des tokens économise à elle seule 36 K-252 K$ par an — la raison pour laquelle le prompt engineering est une prestation facturable, pas un simple confort.

De quoi il s'agit

L'économie de l'inférence est la discipline consistant à faire fonctionner les LLM au coût, à la latence et au débit que les charges de travail enterprise peuvent soutenir. Pour les praticiens SAP, cela signifie comprendre le calcul par 1K tokens pour Joule hébergé sur BTP, connaître les leviers d'optimisation disponibles dans le périmètre de confiance SAP, et être capable de construire un argumentaire commercial pour les dépenses IA que les directeurs financiers (CFO) approuveront.

Pourquoi c'est important

  • Les tokens de sortie coûtent 3-4 fois plus que les tokens d'entrée car la génération est autorégressive, donc réduire la sortie économise plus que réduire l'entrée.
  • Le TTFT évolue avec la longueur d'entrée — un prompt de 10K tokens met environ 10 fois plus de temps à produire un premier token qu'un prompt de 1K tokens, ce qui casse les assistants Joule interactifs sous 2 secondes sauf à borner l'entrée et activer le streaming.
  • La quantisation INT8 divise par deux le calcul et la mémoire pour moins de 1 % de perte de qualité, tandis qu'INT4 économise 4× pour 3-8 % de perte — acceptable pour des résumés, pas pour du support de décision financière.

Points clés

  • Coût d'inférence = tokens d'entrée × tarif entrée + tokens de sortie × tarif sortie ; BTP Generative AI Hub répercute les tarifs OpenAI avec marge SAP (~0,005-0,060 $/1K tokens selon le modèle).
  • Le TTFT évolue avec la longueur d'entrée ; la latence inter-token est approximativement constante — les flux Joule interactifs doivent borner la longueur d'entrée et activer le streaming.
  • Quantisation INT8 : ~2× réduction mémoire/calcul, < 1% perte de qualité — sûr en production pour la plupart des tâches SAP. INT4 : ~4× réduction, 3-8% perte — uniquement pour résumés à faibles enjeux.
  • La distillation entraîne un petit modèle étudiant (7B) à imiter un grand enseignant (GPT-4-class) — réduction de coût 10-100×, 70-90% de précision conservée.
  • Avec 200K sessions Joule SAP quotidiennes, le coût catalogue est de 1 000-7 000 $/jour ; 10% de réduction tokens = 36K-252K$/an d'économies.
  • Compromis batch vs. interactif : pour les traitements SAP nocturnes, maximiser le débit ; pour les assistants Joule interactifs, minimiser le TTFT.

Termes employés sur cette page

TTFT (Time-to-first-token)
Latence entre la soumission de la requête et la production du premier token de sortie ; dominée par la passe de prefill sur l'intégralité du contexte d'entrée.
Quantization
Réduction de la précision numérique des poids du modèle (p. ex. FP16 → INT8 → INT4) pour abaisser l'empreinte mémoire et le calcul d'inférence, avec un arbitrage de qualité maîtrisé.
Distillation
Entraînement d'un modèle élève plus petit à imiter la distribution de sortie d'un modèle enseignant plus grand sur une tâche cible ; produit un modèle spécifique à la tâche 10 à 100× moins cher à l'inférence.
Throughput
Nombre de tokens générés par seconde sur l'ensemble des requêtes concurrentes ; maximisé par de grandes tailles de batch et la quantization ; métrique pertinente pour les charges d'analytique en batch.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisés par les outils et les équipes.
Control plane
La couche qui applique la politique, l'accès, la traçabilité (lineage), la supervision et l'escalade à travers le modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. SAP BTP Generative AI Hub — pricing and service plans
  2. Dettmers et al. — LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale (2022)
  3. Hinton et al. — Distilling the Knowledge in a Neural Network (2015)
  4. Kwon et al. — Efficient Memory Management for LLM Serving with PagedAttention (2023)
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site
  24. SAP Help Portal — Joule
  25. NIST — AI Risk Management Framework
  26. Google Cloud — 101 real-world generative AI use cases

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →