Tokenisation et embeddings dans les pipelines LLM enterprise
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Tokenisation et embeddings dans les pipelines LLM enterprise ?
Les choix de tokenisation gonflent silencieusement les coûts de prompts SAP et tronquent les documents — les termes SAP en allemand coûtent 20-40 % de tokens en plus que l'anglais, et un découpage à taille fixe peut couper une phrase en deux sans prévenir.
La tokenisation et les embeddings sont les deux éléments d'infrastructure invisible qui se situent entre le texte brut et tout ce qu'un grand modèle de langage en fait — et ce sont précisément les éléments qui passent inaperçus jusqu'à ce qu'ils provoquent un pic de coût, une troncature silencieuse de document, ou un échec de récupération qui fait paraître Joule moins performant qu'il ne l'est réellement. Comprendre les deux permet de concevoir des pipelines de connaissance SAP qui fonctionnent dès la première tentative plutôt qu'à la troisième.
Ce que fait la tokenisation
Pourquoi c'est important
- Les termes SAP spécifiques et les mots composés allemands se divisent en 8-12 tokens contre 2-3 pour l'équivalent anglais, gonflant directement le coût par appel.
- Les nombres se tokenisent chiffre par chiffre, donc les numéros de matériaux et codes de centres de coûts gonflent les comptages de tokens et dégradent le raisonnement arithmétique s'ils ne sont pas prétraités.
- Découper la documentation PDF SAP à 512 tokens fixes tronque silencieusement les phrases qui chevauchent la frontière — le modèle ne voit jamais la seconde moitié.
Points clés
- Taille du vocabulaire BPE : GPT-4 utilise ~100K tokens ; les termes composés SAP allemands se tokenisent en 8-12 tokens contre 2-3 pour l'équivalent anglais — prévoir +20-40% de tokens pour les prompts en allemand.
- Les nombres se tokenisent chiffre par chiffre ; les numéros de matériaux SAP gonflent les comptages de tokens et dégradent le raisonnement arithmétique.
- La troncature est silencieuse : toujours découper les documents SAP aux frontières de phrases ou de paragraphes, jamais à des comptages de tokens fixes.
- Les embeddings (768-4096 dimensions) regroupent les textes sémantiquement similaires ; permettent une récupération tolérante aux synonymes que la recherche par mots-clés manque.
- HANA Cloud Vector Engine (GA 2024) stocke et interroge les embeddings nativement — pas besoin de base vectorielle séparée pour la plupart des déploiements SAP.
- Les modèles d'embedding adaptés au domaine SAP sur AI Core surpassent les embeddings génériques OpenAI de 8-15% en recall@5 sur les tâches de récupération SAP.
Termes employés sur cette page
- BPE (Byte-Pair Encoding)
- Algorithme de tokenisation en sous-mots qui fusionne itérativement les paires de caractères adjacentes les plus fréquentes jusqu'à atteindre une taille de vocabulaire cible.
- Embedding
- Représentation vectorielle dense du texte où les textes sémantiquement proches se regroupent dans l'espace de grande dimension ; le socle de la recherche sémantique et de la récupération RAG.
- HANA Cloud Vector Engine
- Capacité native de stockage vectoriel et de recherche du plus proche voisin approximatif (HNSW) dans SAP HANA Cloud (GA 2024), permettant la récupération par embeddings sans base vectorielle distincte.
- Recall@k
- Métrique de qualité de récupération : fraction des documents pertinents retrouvés dans les k premiers résultats ; le benchmark standard d'évaluation d'un pipeline RAG.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, des métriques, des entités et des règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique les politiques, les accès, le lignage, la supervision et l'escalade à l'ensemble du modèle opérationnel.
- Evidence grade
- Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- SAP HANA Cloud Vector Engine documentation
- SAP AI Core — embedding models on BTP
- Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units (BPE, 2016)
- OpenAI tiktoken tokeniser
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.