AI & Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Tokenisation et embeddings dans les pipelines LLM enterprise

Tokenisation et embeddings dans les pipelines LLM enterprise — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-09-27

Qu'est-ce que Tokenisation et embeddings dans les pipelines LLM enterprise ?

Les choix de tokenisation gonflent silencieusement les coûts de prompts SAP et tronquent les documents — les termes SAP en allemand coûtent 20-40 % de tokens en plus que l'anglais, et un découpage à taille fixe peut couper une phrase en deux sans prévenir.

De quoi il s'agit

La tokenisation et les embeddings sont les deux éléments d'infrastructure invisible qui se situent entre le texte brut et tout ce qu'un grand modèle de langage en fait — et ce sont précisément les éléments qui passent inaperçus jusqu'à ce qu'ils provoquent un pic de coût, une troncature silencieuse de document, ou un échec de récupération qui fait paraître Joule moins performant qu'il ne l'est réellement. Comprendre les deux permet de concevoir des pipelines de connaissance SAP qui fonctionnent dès la première tentative plutôt qu'à la troisième.

Pourquoi c'est important

  • Les termes SAP spécifiques et les mots composés allemands se divisent en 8-12 tokens contre 2-3 pour l'équivalent anglais, gonflant directement le coût par appel.
  • Les nombres se tokenisent chiffre par chiffre, donc les numéros de matériaux et codes de centres de coûts gonflent les comptages de tokens et dégradent le raisonnement arithmétique s'ils ne sont pas prétraités.
  • Découper la documentation PDF SAP à 512 tokens fixes tronque silencieusement les phrases qui chevauchent la frontière — le modèle ne voit jamais la seconde moitié.

Points clés

  • Taille du vocabulaire BPE : GPT-4 utilise ~100K tokens ; les termes composés SAP allemands se tokenisent en 8-12 tokens contre 2-3 pour l'équivalent anglais — prévoir +20-40% de tokens pour les prompts en allemand.
  • Les nombres se tokenisent chiffre par chiffre ; les numéros de matériaux SAP gonflent les comptages de tokens et dégradent le raisonnement arithmétique.
  • La troncature est silencieuse : toujours découper les documents SAP aux frontières de phrases ou de paragraphes, jamais à des comptages de tokens fixes.
  • Les embeddings (768-4096 dimensions) regroupent les textes sémantiquement similaires ; permettent une récupération tolérante aux synonymes que la recherche par mots-clés manque.
  • HANA Cloud Vector Engine (GA 2024) stocke et interroge les embeddings nativement — pas besoin de base vectorielle séparée pour la plupart des déploiements SAP.
  • Les modèles d'embedding adaptés au domaine SAP sur AI Core surpassent les embeddings génériques OpenAI de 8-15% en recall@5 sur les tâches de récupération SAP.

Termes employés sur cette page

BPE (Byte-Pair Encoding)
Algorithme de tokenisation en sous-mots qui fusionne itérativement les paires de caractères adjacentes les plus fréquentes jusqu'à atteindre une taille de vocabulaire cible.
Embedding
Représentation vectorielle dense du texte où les textes sémantiquement proches se regroupent dans l'espace de grande dimension ; le socle de la recherche sémantique et de la récupération RAG.
HANA Cloud Vector Engine
Capacité native de stockage vectoriel et de recherche du plus proche voisin approximatif (HNSW) dans SAP HANA Cloud, permettant la récupération par embeddings sans base vectorielle distincte.
Recall@k
Métrique de qualité de récupération : fraction des documents pertinents retrouvés dans les k premiers résultats ; le benchmark standard d'évaluation d'un pipeline RAG.
SentencePiece / WordPiece
Schémas de tokenisation en sous-mots proches du BPE (SentencePiece : Kudo & Richardson 2018 ; WordPiece : utilisé dans BERT, Devlin et al. 2018) — diffèrent par leur critère de fusion mais partagent le même surcoût chiffre-par-chiffre et mot-composé décrit dans cette fiche.
Chunking (découpage)
Le fait de scinder un document source en passages assez petits pour être embarqués et récupérés individuellement. La frontière du chunk doit suivre la structure de phrase ou de paragraphe — découper à un comptage de tokens fixe tronque silencieusement le contenu en plein milieu d'une phrase.
Index vectoriel (HNSW)
Le graphe Hierarchical Navigable Small World (Malkov & Yashunin, 2016) : la structure d'index de plus proche voisin approximatif que la plupart des bases vectorielles de production, dont le Vector Engine de SAP HANA Cloud, utilisent pour rendre la recherche de similarité rapide à l'échelle.
Modèle d'embedding adapté au domaine
Un modèle d'embedding entraîné plus avant sur du texte spécifique à un domaine (ex. SAP Help Portal, documentation S/4HANA) plutôt que sur du seul texte web ouvert — améliore mesurablement le recall@k sur la récupération spécifique au domaine face à une référence générique solide, au prix d'une dépendance d'hébergement et de ré-embedding.

Sources

  1. SAP HANA Cloud Vector Engine documentation
  2. SAP AI Core — embedding models on BTP
  3. Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units (BPE, 2016)
  4. OpenAI tiktoken tokeniser
  5. SAP Business AI — official product page
  6. SAP Joule (work companion) — official product page
  7. SAP Generative AI — official product page
  8. SAP Community — Querying RDF Graphs with SAP HANA Cloud Knowledge Graph Engine
  9. OpenAI — New embedding models and API updates (text-embedding-3-large, 2024)
  10. Kudo & Richardson — SentencePiece, arXiv:1808.06226 (2018)
  11. Devlin et al. — BERT: Pre-training of Deep Bidirectional Transformers (WordPiece), arXiv:1810.04805 (2018)
  12. Malkov & Yashunin — Efficient and Robust Approximate Nearest Neighbor Search Using HNSW, arXiv:1603.09320 (2016)

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.

Ouvrir dans l'application →