Analytics Legends La plateforme de connaissance SAP Analytics
Module d'académie

Ingénierie du coût des LLM — AI Units, budgets de tokens, caching

Ingénierie du coût des LLM — AI Units, budgets de tokens, caching — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-25

SAP tarife l'IA générative selon deux monnaies qui ne doivent jamais être mélangées : les capacity units, converties depuis les tokens via un ratio de GenAI token propre au modèle publié dans la note SAP 3437766, et les AI Units, la monnaie virtuelle unique de SAP pour l'IA Premium — les agents autonomes à 0,02 AI Unit par action, SAP Joule for Consultants à 35 AI Units et jusqu'à 22 900 requêtes mutualisées par utilisateur et par mois. Ce module s'appuie sur la documentation de SAP AI Core sur les limites de débit et le prompt caching pour couvrir la séquence de mitigation d'une erreur 429 de limite de débit, le placement explicite de cache_control et ses différences entre Claude et Nova, les champs d'usage (cached_tokens, cache_creation_tokens) qui prouvent qu'une stratégie de caching a réellement fonctionné, et la discipline de gouvernance d'un budget de tokens par fonctionnalité fixé à partir de l'usage mesuré avec un seuil d'alerte significatif. Il se termine par une séquence en cinq étapes pour construire un dossier de coût daté et sourcé plutôt qu'une estimation anxieuse. Trois exercices et une auto-évaluation conditionnent le passage à M366.

Ce que vous apprendrez

  • Distinguer les deux monnaies de coût de SAP — capacity units pour le generative AI hub et AI Units pour l'IA Business premium — et classer une charge dans la bonne sans les mélanger
  • Citer avec exactitude et datation les chiffres d'AI Units publiés par SAP elle-même (0,02 AI Unit par action d'agent ; 35 AI Units et jusqu'à 22 900 requêtes mutualisées par utilisateur et par mois pour Joule for Consultants)
  • Expliquer le fonctionnement des limites de débit du generative AI hub (RPM, périmètre resource group contre tenant, processus d'augmentation de quota) et appliquer la bonne séquence de mitigation en cas de dépassement
  • Concevoir une stratégie de prompt caching explicite — placement correct de cache_control, choix du TTL, différences entre les familles de modèles Claude et Nova — et vérifier ses économies à partir de cached_tokens et cache_creation_tokens
  • Fixer et gouverner un budget de tokens par fonctionnalité, fondé sur l'usage mesuré avec un seuil d'alerte, pas une estimation au niveau du tenant
  • Construire un dossier de coût daté et sourcé pour une mission client qui ne confond jamais capacity units et AI Units

Aperçu du module

À qui s'adresse ce module. Le M333 a introduit la chaîne de mesure de SAP — tokens vers GenAI tokens vers capacity units — et mis en garde contre le fait de citer l'exemple chiffré fictif de SAP comme un prix. Ce module va plus loin : il sépare les deux monnaies de coût réellement différentes de SAP (les capacity units pour le generative AI hub, les AI Units pour l'IA Business premium), et donne les trois leviers qui déplacent réellement une ligne de coût — les limites de débit, le prompt caching, et le simple fait de savoir dans quelle monnaie on dépense.

Prérequis

  • M333 (Fondamentaux IA et LLM) — ce module s'appuie directement sur sa chaîne tokens vers GenAI tokens vers capacity units et sur la note SAP 3437766
  • Familiarité de base avec la structure de requête du service d'orchestration (module_configurations, prompt_templating)
  • Optionnel : accès au generative AI hub pour exécuter E1-E2 sur des données d'usage réelles plutôt que sur papier

Acquis

  • Classer correctement toute charge d'IA générative en capacity units ou en AI Units avant d'en estimer le coût
  • Produire un plan de déploiement conscient des limites de débit, nommant la séquence de mitigation et le délai d'augmentation de quota
  • Concevoir et vérifier une configuration de prompt caching qui réduit mesurablement le coût, pas seulement une configuration qui a l'air correcte
  • Fixer un budget de tokens par fonctionnalité avec une base mesurée et un seuil d'alerte significatif

Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.

Ouvrir dans l'application →