Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Tokenisation et embeddings dans les pipelines LLM enterprise

Tokenisation et embeddings dans les pipelines LLM enterprise — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-24T14:00:00Z

Qu'est-ce que Tokenisation et embeddings dans les pipelines LLM enterprise ?

Les choix de tokenisation gonflent silencieusement les coûts de prompts SAP et tronquent les documents — les termes SAP en allemand coûtent 20-40 % de tokens en plus que l'anglais, et un découpage à taille fixe peut couper une phrase en deux sans prévenir.

La tokenisation et les embeddings sont les deux éléments d'infrastructure invisible qui se situent entre le texte brut et tout ce qu'un grand modèle de langage en fait — et ce sont précisément les éléments qui passent inaperçus jusqu'à ce qu'ils provoquent un pic de coût, une troncature silencieuse de document, ou un échec de récupération qui fait paraître Joule moins performant qu'il ne l'est réellement. Comprendre les deux permet de concevoir des pipelines de connaissance SAP qui fonctionnent dès la première tentative plutôt qu'à la troisième.

Ce que fait la tokenisation

Pourquoi c'est important

  • Les termes SAP spécifiques et les mots composés allemands se divisent en 8-12 tokens contre 2-3 pour l'équivalent anglais, gonflant directement le coût par appel.
  • Les nombres se tokenisent chiffre par chiffre, donc les numéros de matériaux et codes de centres de coûts gonflent les comptages de tokens et dégradent le raisonnement arithmétique s'ils ne sont pas prétraités.
  • Découper la documentation PDF SAP à 512 tokens fixes tronque silencieusement les phrases qui chevauchent la frontière — le modèle ne voit jamais la seconde moitié.

Points clés

  • Taille du vocabulaire BPE : GPT-4 utilise ~100K tokens ; les termes composés SAP allemands se tokenisent en 8-12 tokens contre 2-3 pour l'équivalent anglais — prévoir +20-40% de tokens pour les prompts en allemand.
  • Les nombres se tokenisent chiffre par chiffre ; les numéros de matériaux SAP gonflent les comptages de tokens et dégradent le raisonnement arithmétique.
  • La troncature est silencieuse : toujours découper les documents SAP aux frontières de phrases ou de paragraphes, jamais à des comptages de tokens fixes.
  • Les embeddings (768-4096 dimensions) regroupent les textes sémantiquement similaires ; permettent une récupération tolérante aux synonymes que la recherche par mots-clés manque.
  • HANA Cloud Vector Engine (GA 2024) stocke et interroge les embeddings nativement — pas besoin de base vectorielle séparée pour la plupart des déploiements SAP.
  • Les modèles d'embedding adaptés au domaine SAP sur AI Core surpassent les embeddings génériques OpenAI de 8-15% en recall@5 sur les tâches de récupération SAP.

Termes employés sur cette page

BPE (Byte-Pair Encoding)
Algorithme de tokenisation en sous-mots qui fusionne itérativement les paires de caractères adjacentes les plus fréquentes jusqu'à atteindre une taille de vocabulaire cible.
Embedding
Représentation vectorielle dense du texte où les textes sémantiquement proches se regroupent dans l'espace de grande dimension ; le socle de la recherche sémantique et de la récupération RAG.
HANA Cloud Vector Engine
Capacité native de stockage vectoriel et de recherche du plus proche voisin approximatif (HNSW) dans SAP HANA Cloud (GA 2024), permettant la récupération par embeddings sans base vectorielle distincte.
Recall@k
Métrique de qualité de récupération : fraction des documents pertinents retrouvés dans les k premiers résultats ; le benchmark standard d'évaluation d'un pipeline RAG.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, des métriques, des entités et des règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique les politiques, les accès, le lignage, la supervision et l'escalade à l'ensemble du modèle opérationnel.
Evidence grade
Un label qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. SAP HANA Cloud Vector Engine documentation
  2. SAP AI Core — embedding models on BTP
  3. Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units (BPE, 2016)
  4. OpenAI tiktoken tokeniser
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →