AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Économie de l'inférence — Coût, latence, quantisation, distillation

Économie de l'inférence — Coût, latence, quantisation, distillation — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Économie de l'inférence ?

À 200K sessions Joule quotidiennes, une réduction de 10 % des tokens économise à elle seule un montant estimé à 36 K-252 K$ par an (ordre de grandeur sur les prix publics des éditeurs, pas un tarif SAP) — la raison pour laquelle le prompt engineering est une prestation facturable, pas un simple confort.

De quoi il s'agit

L'économie de l'inférence est la discipline consistant à faire fonctionner les LLM au coût, à la latence et au débit que les charges de travail enterprise peuvent soutenir. Pour les praticiens SAP, cela signifie comprendre le calcul par 1K tokens pour Joule hébergé sur BTP, connaître les leviers d'optimisation disponibles dans le périmètre de confiance SAP, et être capable de construire un argumentaire commercial pour les dépenses IA que les directeurs financiers (CFO) approuveront.

Pourquoi c'est important

  • Les tokens de sortie coûtent 3-4 fois plus que les tokens d'entrée car la génération est autorégressive, donc réduire la sortie économise plus que réduire l'entrée.
  • Le TTFT évolue avec la longueur d'entrée — un prompt de 10K tokens met environ 10 fois plus de temps à produire un premier token qu'un prompt de 1K tokens, ce qui casse les assistants Joule interactifs sous 2 secondes sauf à borner l'entrée et activer le streaming.
  • La quantisation INT8 divise par deux le calcul et la mémoire pour moins de 1 % de perte de qualité, tandis qu'INT4 économise 4× pour 3-8 % de perte — acceptable pour des résumés, pas pour du support de décision financière.

Points clés

  • Coût d'inférence = tokens d'entrée × tarif entrée + tokens de sortie × tarif sortie ; BTP Generative AI Hub facture la consommation des modèles en unités de capacité AI Core selon le barème publié par SAP — citez-le depuis ce barème et votre contrat BTP, jamais depuis le prix public au token d'un éditeur.
  • Le TTFT évolue avec la longueur d'entrée ; la latence inter-token est approximativement constante — les flux Joule interactifs doivent borner la longueur d'entrée et activer le streaming.
  • Quantisation INT8 : ~2× réduction mémoire/calcul, < 1% perte de qualité — sûr en production pour la plupart des tâches SAP. INT4 : ~4× réduction, 3-8% perte — uniquement pour résumés à faibles enjeux.
  • La distillation entraîne un petit modèle étudiant (7B) à imiter un grand enseignant (GPT-4-class) — réduction de coût 10-100×, 70-90% de précision conservée.
  • Estimation, pas un tarif SAP : avec 200K sessions Joule SAP quotidiennes (1K tokens d'entrée + 500 de sortie), les prix publics des éditeurs donnent 1 000-7 000 $/jour ; 10 % de réduction de tokens = 36K-252K $/an.
  • Compromis batch vs. interactif : pour les traitements SAP nocturnes, maximiser le débit ; pour les assistants Joule interactifs, minimiser le TTFT.

Termes employés sur cette page

TTFT (Time-to-first-token)
Latence entre la soumission de la requête et la production du premier token de sortie ; dominée par la passe de prefill sur l'intégralité du contexte d'entrée.
Quantization
Réduction de la précision numérique des poids du modèle (p. ex. FP16 → INT8 → INT4) pour abaisser l'empreinte mémoire et le calcul d'inférence, avec un arbitrage de qualité maîtrisé (voir C243 pour le détail des stratégies).
Distillation
Entraînement d'un modèle élève plus petit à imiter la distribution de sortie d'un modèle enseignant plus grand sur une tâche cible ; produit un modèle spécifique à la tâche 10 à 100× moins cher à l'inférence, au prix d'un entraînement ponctuel.
Throughput
Nombre de tokens générés par seconde sur l'ensemble des requêtes concurrentes ; maximisé par de grandes tailles de batch et la quantization ; métrique pertinente pour les charges d'analytique en batch.
Capacity unit AI Core
L'unité dans laquelle SAP BTP Generative AI Hub facture réellement la consommation des modèles, par modèle et par sens de token, selon le barème publié par SAP — le chiffre à convertir depuis le contrat BTP du client, jamais un prix public au token d'un éditeur répercuté tel quel.
Bring Your Own Generative AI (BYOG)
Le chemin documenté de SAP AI Core pour auto-héberger un modèle ouvert ou quantifié sur mesure (Ollama, LocalAI, llama.cpp, vLLM, serveur Hugging Face Transformers sur mesure) plutôt que de consommer un modèle de fondation hébergé via le generative AI hub.
Lié au calcul vs lié à la mémoire
Si la vitesse d'une charge est limitée par le débit arithmétique de l'accélérateur (lié au calcul, favorise le batching) ou par la vitesse de déplacement des données entre niveaux de mémoire (lié à la mémoire, favorise les techniques FlashAttention/KV-cache, voir C214/C221).

Sources

  1. SAP BTP Generative AI Hub — pricing and service plans
  2. Dettmers et al. — LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale (2022)
  3. Hinton et al. — Distilling the Knowledge in a Neural Network (2015)
  4. Kwon et al. — Efficient Memory Management for LLM Serving with PagedAttention (2023)
  5. SAP Help Portal — Joule
  6. Google Cloud — 101 real-world generative AI use cases
  7. GitHub SAP-samples — btp-generative-ai-hub-use-cases: bring-your-own OSS LLM on SAP AI Core (Ollama, LocalAI, llama.cpp, vLLM, custom HF Transformers server; Standard/Extended plan required)
  8. SAP Help Portal — Choose a Resource Plan for training/inference in SAP AI Core (GPU instance types incl. SAP Note 3660109)
  9. SAP News Center — How SAP and NVIDIA Advance Enterprise AI Transformation (NIM inference optimisation, SAP-ABAP-1, 2026-03-17)
  10. SAP — AI pricing and AI Units (product pricing page)
  11. GitHub SAP-samples — btp-gen-ai-hub-sdk-samples: setting up the Extended AI Core service plan (the plan tier required for self-hosted BYOG serving)
  12. SAP — Value of AI: Oxford Economics 2026 (report PDF, ROI benchmark context for a cost/benefit comparison)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →