Les rouages des LLM pour architectes SAP — attention, encodage positionnel, long contexte et mélange d'experts
À jour au 2026-10-04
Ouvre le modèle derrière le generative AI hub de SAP pour les architectes qui le consomment déjà. Il enseigne l'attention par produit scalaire normalisé et le cache KV, l'attention par groupes de requêtes, les plongements de position rotatifs et les méthodes d'extension de contexte qui en dérivent, l'écart entre contexte annoncé et contexte effectif (Lost in the Middle, RULER), l'attention à fenêtre glissante et éparse, et le routage en mélange d'experts (Mixtral, DeepSeek-V3), chacun relié à une conséquence : temps jusqu'au premier token, mémoire par utilisateur, tokens facturés, retrait et limites de débit. L'atelier transforme les champs de découverte de modèles et l'exemple de mesure documentés par SAP AI Core en fiche de dimensionnement pour un assistant ancré sur Datasphere, avec un test de position sur vos propres données.
Ce que vous apprendrez
- Expliquer l'attention par produit scalaire normalisé, l'attention multi-têtes et le cache KV assez bien pour prédire comment la longueur du prompt pilote le temps jusqu'au premier token et la mémoire
- Calculer la taille du cache KV d'un modèle à partir de ses couches, de ses têtes clé-valeur et de sa dimension de tête, et montrer ce que change l'attention par groupes de requêtes
- Décrire comment les plongements de position rotatifs encodent la position relative, pourquoi les modèles échouent au-delà de leur longueur d'entraînement, et ce que font l'interpolation de positions et YaRN
- Séparer la fenêtre de contexte annoncée de la fenêtre effective grâce à Lost in the Middle et RULER, et concevoir un budget de prompt en conséquence
- Expliquer l'attention à fenêtre glissante, l'attention éparse et le routage en mélange d'experts, et dire quel coût ils réduisent (calcul par token) et lequel ils laissent (mémoire pour tous les experts)
- Lire les champs de découverte de modèles de SAP AI Core (contextLength, inputCost, outputCost, retirementDate), la page de mesure et celle des limites de débit, et en tirer une décision de dimensionnement pour un assistant ancré sur Datasphere
Aperçu du module
À qui s'adresse ce module. Vous utilisez déjà le SAP generative AI hub : vous avez choisi un nom de modèle dans une configuration d'orchestration, vu un 429 et été surpris par une facture de tokens. Ce module ouvre la boîte un niveau plus bas. Il explique les cinq mécanismes qui décident de ce qu'un grand modèle de langage peut lire, de la vitesse à laquelle il répond et de ce qu'il coûte : l'attention, l'encodage positionnel, la fenêtre de contexte, le cache clé-valeur et le routage en mélange d'experts. Il suppose M333 (fondamentaux IA et LLM pour consultants SAP) et gagne à suivre M325 (generative AI hub en pratique) et M365 (coût des LLM). Il apprend à lire une fiche de modèle, un champ contextLength et une courbe de latence en architecte. Sources primaires : articles originaux arXiv et documentation des éditeurs ; chaque mécanisme se termine par une conséquence exploitable dans un projet SAP.
Prérequis
- Avoir suivi M333 (fondamentaux IA et LLM pour consultants SAP) ou disposer d'une connaissance équivalente des tokens, des plongements et du contexte
- Algèbre linéaire de base (produit scalaire, multiplication matricielle) et aisance à lire une fiche de modèle ou un résumé arXiv
- Facultatif : un tenant SAP AI Core avec le plan étendu (generative AI hub) pour exécuter l'appel de découverte de modèles ; sinon, utiliser la description des champs dans la documentation SAP
Acquis
- Prédire, à partir de la longueur du prompt et de la forme du modèle, si une requête sera lente à démarrer, lente à s'afficher ou contrainte par la mémoire, et dire quel mécanisme en est la cause.
- Dimensionner un cache KV et un volume mensuel de tokens pour un assistant ancré et défendre les chiffres avec les champs documentés par SAP.
- Concevoir un budget de prompt et un test de position qui révèlent l'écart entre contexte annoncé et contexte effectif.
- Expliquer à un client pourquoi un modèle en mélange d'experts peut être peu coûteux par token et coûteux à héberger, sans citer de prix que SAP n'a pas publié.
- Choisir, preuves à l'appui, entre agréger dans la couche de données, récupérer moins de fragments et passer à une fenêtre plus grande.
Module complet réservé aux abonnés. Le module complet ajoute : le cadre de décision · le cas guidé de bout en bout · la grille de KPI · les anti-patterns · les blocs de code · le contrôle de connaissances · les schémas.