SAP Model Gateway
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que SAP Model Gateway ?
La vraie valeur de la Gateway est qu'un changement de règle de routage — nouveau modèle, nouveau plafond de coût — prend effet sans redéployer un seul Joule Skill, découplant totalement la sélection du modèle de la couche applicative.
Le SAP Model Gateway est la couche de régulation du trafic qui se situe entre chaque application SAP capable d'appeler un grand modèle de langage — Joule, les fonctionnalités génératives de SAC, l'assistance IA à la modélisation de Datasphere — et les fournisseurs de modèles de fondation qui exécutent réellement l'inférence : OpenAI, Anthropic, Google, et les modèles affinés propres à SAP. Sa mission paraît banale et constitue en réalité l'une des décisions d'architecture les plus lourdes de conséquences de toute la SAP Business AI Platform : elle permet à une application de demander « une complétion de niveau de qualité Premium » plutôt que de coder en dur « appeler GPT-4o » ou « appeler Claude Opus », de sorte que le modèle qui répond réellement à la demande puisse changer — pour des raisons de coût, de performance, ou à l'occasion d'une nouvelle sortie de modèle — sans que personne n'ait à toucher au Joule Skill ou au workflow d'agent qui le consomme.
Pourquoi cette indirection mérite une couche architecturale
Pourquoi c'est important
- Le coût est refacturé par workflow d'agent à l'unité métier propriétaire via des appels d'inférence étiquetés (ID application, ID skill, centre de coût)
- Les quotas de tokens par application et par utilisateur empêchent une boucle d'agent incontrôlée de consommer tout le budget LLM mensuel
- Le basculement automatique vers un modèle de secours (ex. Claude Sonnet) évite aux applications consommatrices d'implémenter leur propre logique de nouvelle tentative
Points clés
- Routage multi-LLM : abstrait la sélection du modèle des Joule Skills — l'application déclare le niveau de qualité, la Gateway résout le modèle.
- Attribution des coûts : chaque appel d'inférence étiqueté par application, Skill, workflow d'agent et centre de coût — permet le reporting FinOps par agent.
- Gestion des quotas : plafonds stricts de tokens par application/agent/utilisateur — prévient les boucles incontrôlées de consommer le budget LLM mensuel.
- Basculement automatique : erreurs de limite de débit sur le modèle principal → la Gateway route vers le modèle de secours sans logique de relance de l'application consommatrice.
- Règles de routage configurables dans SAP AI Launchpad sans redéploiement des Joule Skills consommateurs.
- Pattern FinOps : transférer les étapes à volume élevé et faible complexité du niveau Premium vers le modèle fine-tuné SAP Economy — réduction des coûts de 60-80 % sur ces étapes.
- Configuration de quota recommandée : plafond quotidien de tokens par agent à 3× la consommation au 90e percentile lors de la recette, révisé mensuellement.
Termes employés sur cette page
- Niveau de qualité
- Dimension de configuration Model Gateway qui regroupe les modèles par niveau de capacité (Économique = fine-tuné SAP, rapide, faible coût ; Standard = commercial milieu de gamme ; Premium = GPT-4o, Claude Sonnet, capacité complète) ; les Joule Skills demandent un niveau, pas un modèle nommé.
- FinOps pour l'IA
- Discipline des opérations financières appliquée aux charges de travail IA : suivi, attribution et optimisation du coût des appels d'inférence LLM par unité métier, application et workflow d'agent.
- Quota de tokens
- Limite configurable sur le nombre de tokens entrée+sortie LLM qu'une application, un agent ou un utilisateur donné peut consommer par jour/mois ; appliqué par la Model Gateway comme un arrêt dur, pas un avertissement souple.
- Règle de routage
- Une paire condition-action dans la Model Gateway : si type_tâche=contexte_long ET niveau_qualité=Premium ALORS router vers anthropic.claude-37-sonnet ; configurable sans redéploiement.
Sources
- SAP Sapphire Orlando 2026 — SAP Model Gateway GA announcement
- SAP AI Foundation — Model Gateway documentation
- SAP Business AI pricing — model tiers and consumption billing
- Gartner — 40% agentic project cancellation forecast (cost control failure mode)
- Gartner — outcome-priced AI platforms by 2028
- SAP Q1 FY2026 earnings — Business AI platform scale
- SAP AI Launchpad — administration guide
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.