Attribution des coûts IA — Facturation Model Gateway par scénario
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Attribution des coûts IA — Facturation Model Gateway par scénario ?
Une seule interaction « résume ma réunion » peut discrètement déclencher trois appels de modèles chaînés totalisant 8 500 à 23 600 tokens — négligeable pour 100 utilisateurs, mais 290 000 à 875 000 € par an pour 10 000 utilisateurs à 20 interactions par jour.
De quoi il s'agit
Le Model Gateway de SAP AI Core est la couche d'inférence managée par laquelle transite chaque requête Joule, chaque flux d'IA générative dans SAP Build, et chaque appel personnalisé à un grand modèle de langage, sur son chemin vers un modèle. Il existe en partie par commodité — une seule surface d'authentification, une seule couche de nouvelle tentative et de limitation de débit au lieu que chaque application gère la sienne — et en partie pour le contrôle : le Gateway est aussi l'unique point de mesure que SAP utilise pour facturer la consommation d'IA. Comprendre comment fonctionne cette facturation, au niveau de chaque appel de modèle et de chaque scénario métier, fait la différence entre un programme IA qui reste dans son budget et un programme qui déclenche une revue financière d'urgence au troisième mois, une fois la facture arrivée et alors que personne ne peut expliquer quelle fonctionnalité en est la cause.
Pourquoi c'est important
- Une seule requête utilisateur peut se décomposer en un appel RAG, un appel de résumé et un appel de formatage — trois inférences facturées, pas une
- Le coût par interaction (0,004 à 0,012 €) paraît négligeable jusqu'à ce qu'on le multiplie par l'échelle : 10 000 utilisateurs × 20 interactions/jour = 800 à 2 400 €/jour
- Comprendre cette décomposition en scénarios est ce qui distingue un programme IA qui reste dans son budget d'un autre déclenchant une révision d'urgence au troisième mois
Points clés
- Le Model Gateway est le routeur d'inférence géré de SAP AI Core — tous les appels Joule, Build GenAI et LLM personnalisés sont mesurés en tokens (entrée + sortie).
- Une seule interaction Joule déclenche 3–4 appels de modèles (récupération RAG + résumé + formatage) ; plage typique 8 500–23 600 tokens par interaction.
- À 10 000 utilisateurs × 20 interactions/jour, le tarif modèle intermédiaire implique 290k–875k €/an — la modélisation des coûts avant le go-live est non négociable.
- Top 4 leviers de coûts : ingénierie des prompts (déplacer le contexte statique vers le KG), réduction du nombre de chunks via re-ranking, sélection du niveau de modèle, mise en cache sémantique.
- Utiliser l'en-tête `resource-group` de l'API AI Core pour attribuer la consommation de tokens par domaine métier — sans cela, la facture IA mensuelle n'est attribuable à personne.
- Les chaînes agentiques multi-étapes coûtent 15–40× le RAG à un seul tour ; définir un plafond de tours maximaux (4–6 pour les workflows d'entreprise).
- Les gardes sur la longueur d'entrée empêchent les pics d'ingestion de longs documents (contrat 50 pages = 40 000–80 000 tokens en un seul appel).
Termes employés sur cette page
- Model Gateway
- Routeur d'inférence centralisé de SAP AI Core — gère l'authentification, la limitation de débit, les réessais et la mesure des tokens pour tous les appels LLM de Joule et des applications BTP.
- Token
- Unité de facturation de l'inférence LLM — environ 4 caractères ou 0,75 mots. Un prompt de 1 000 mots ≈ 1 333 tokens d'entrée.
- RAG (Retrieval-Augmented Generation)
- Motif qui récupère des chunks de documents pertinents du Knowledge Graph et les passe comme contexte au LLM — ancre les réponses dans les données d'entreprise, ajoute un coût en tokens d'entrée.
- Mise en cache sémantique
- Technique qui stocke les réponses LLM par similarité d'embedding — sur une requête ultérieure cosine-similaire, retourne la réponse en cache sans appel LLM en direct.
- Cross-encoder re-ranker
- Modèle léger qui score la pertinence des chunks RAG récupérés avant de les passer au LLM principal — réduit le nombre de tokens d'entrée de 50–70% avec une perte de qualité minimale.
- resource-group
- En-tête optionnel de l'API AI Core qui tague la consommation de tokens par groupe logique nommé — permet à la gestion des coûts BTP de ventiler les dépenses IA par domaine métier.
Sources
- SAP AI Core — Help Portal (Model Gateway, pricing, resource groups)
- SAP BTP Cost Management documentation
- SAP TechEd 2025 — AI Core Model Gateway architecture session
- SAP Community — Generative AI Hub and AI Core best practices
- OpenAI — Tokenization reference (tiktoken, token counting)
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- EU AI Act — Regulation (EU) 2024/1689, Art. 14 (Human Oversight)
- CJEU Case C-311/18 — Schrems-II ruling (EUR-Lex)
- SAP Help Portal — SAP AI Core documentation
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.