Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Attribution des coûts IA — Facturation Model Gateway par scénario

Attribution des coûts IA — Facturation Model Gateway par scénario — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Attribution des coûts IA — Facturation Model Gateway par scénario ?

Une seule interaction « résume ma réunion » peut discrètement déclencher trois appels de modèles chaînés totalisant 8 500 à 23 600 tokens — négligeable pour 100 utilisateurs, mais 290 000 à 875 000 € par an pour 10 000 utilisateurs à 20 interactions par jour.

De quoi il s'agit

Le Model Gateway de SAP AI Core est la couche d'inférence managée par laquelle transite chaque requête Joule, chaque flux d'IA générative dans SAP Build, et chaque appel personnalisé à un grand modèle de langage, sur son chemin vers un modèle. Il existe en partie par commodité — une seule surface d'authentification, une seule couche de nouvelle tentative et de limitation de débit au lieu que chaque application gère la sienne — et en partie pour le contrôle : le Gateway est aussi l'unique point de mesure que SAP utilise pour facturer la consommation d'IA. Comprendre comment fonctionne cette facturation, au niveau de chaque appel de modèle et de chaque scénario métier, fait la différence entre un programme IA qui reste dans son budget et un programme qui déclenche une revue financière d'urgence au troisième mois, une fois la facture arrivée et alors que personne ne peut expliquer quelle fonctionnalité en est la cause.

Pourquoi c'est important

  • Une seule requête utilisateur peut se décomposer en un appel RAG, un appel de résumé et un appel de formatage — trois inférences facturées, pas une
  • Le coût par interaction (0,004 à 0,012 €) paraît négligeable jusqu'à ce qu'on le multiplie par l'échelle : 10 000 utilisateurs × 20 interactions/jour = 800 à 2 400 €/jour
  • Comprendre cette décomposition en scénarios est ce qui distingue un programme IA qui reste dans son budget d'un autre déclenchant une révision d'urgence au troisième mois

Points clés

  • Le Model Gateway est le routeur d'inférence géré de SAP AI Core — tous les appels Joule, Build GenAI et LLM personnalisés sont mesurés en tokens (entrée + sortie).
  • Une seule interaction Joule déclenche 3–4 appels de modèles (récupération RAG + résumé + formatage) ; plage typique 8 500–23 600 tokens par interaction.
  • À 10 000 utilisateurs × 20 interactions/jour, le tarif modèle intermédiaire implique 290k–875k €/an — la modélisation des coûts avant le go-live est non négociable.
  • Top 4 leviers de coûts : ingénierie des prompts (déplacer le contexte statique vers le KG), réduction du nombre de chunks via re-ranking, sélection du niveau de modèle, mise en cache sémantique.
  • Utiliser l'en-tête `resource-group` de l'API AI Core pour attribuer la consommation de tokens par domaine métier — sans cela, la facture IA mensuelle n'est attribuable à personne.
  • Les chaînes agentiques multi-étapes coûtent 15–40× le RAG à un seul tour ; définir un plafond de tours maximaux (4–6 pour les workflows d'entreprise).
  • Les gardes sur la longueur d'entrée empêchent les pics d'ingestion de longs documents (contrat 50 pages = 40 000–80 000 tokens en un seul appel).

Termes employés sur cette page

Model Gateway
Routeur d'inférence centralisé de SAP AI Core — gère l'authentification, la limitation de débit, les réessais et la mesure des tokens pour tous les appels LLM de Joule et des applications BTP.
Token
Unité de facturation de l'inférence LLM — environ 4 caractères ou 0,75 mots. Un prompt de 1 000 mots ≈ 1 333 tokens d'entrée.
RAG (Retrieval-Augmented Generation)
Motif qui récupère des chunks de documents pertinents du Knowledge Graph et les passe comme contexte au LLM — ancre les réponses dans les données d'entreprise, ajoute un coût en tokens d'entrée.
Mise en cache sémantique
Technique qui stocke les réponses LLM par similarité d'embedding — sur une requête ultérieure cosine-similaire, retourne la réponse en cache sans appel LLM en direct.
Cross-encoder re-ranker
Modèle léger qui score la pertinence des chunks RAG récupérés avant de les passer au LLM principal — réduit le nombre de tokens d'entrée de 50–70% avec une perte de qualité minimale.
resource-group
En-tête optionnel de l'API AI Core qui tague la consommation de tokens par groupe logique nommé — permet à la gestion des coûts BTP de ventiler les dépenses IA par domaine métier.

Sources

  1. SAP AI Core — Help Portal (Model Gateway, pricing, resource groups)
  2. SAP BTP Cost Management documentation
  3. SAP TechEd 2025 — AI Core Model Gateway architecture session
  4. SAP Community — Generative AI Hub and AI Core best practices
  5. OpenAI — Tokenization reference (tiktoken, token counting)
  6. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  7. SAP News Center — SAP Unveils the Autonomous Enterprise
  8. SAP News Center — The Future of the Enterprise Is Autonomous
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP — industries overview
  17. Gartner — research & analyst site
  18. BARC — BI & Analytics research
  19. TDWI — data & analytics research
  20. DSAG — German-speaking SAP user group
  21. ASUG — Americas' SAP User Group
  22. Databricks — official site
  23. EU AI Act — Regulation (EU) 2024/1689, Art. 14 (Human Oversight)
  24. CJEU Case C-311/18 — Schrems-II ruling (EUR-Lex)
  25. SAP Help Portal — SAP AI Core documentation

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →