Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Tokenisation

Tokenisation — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que Tokenisation ?

Le choix du tokeniseur fixe silencieusement le vocabulaire effectif d'un modèle, ses performances multilingues et son coût API — et découper les nombres chiffre par chiffre est la raison précise pour laquelle l'arithmétique des LLM reste peu fiable sans données d'entraînement numériques abondantes.

De quoi il s'agit

La tokenisation est le processus de conversion de texte brut en une séquence d'identifiants entiers qu'un LLM peut traiter. Ce n'est pas un détail de prétraitement — elle détermine le vocabulaire effectif du modèle, sa gestion des mots rares, ses performances multilingues, et pilote directement le coût des API.

Le problème central qu'elle résout est de représenter un espace de chaînes ouvert avec une table d'embeddings de taille fixe tout en maintenant des longueurs de séquence gérables. Les modèles au niveau des caractères produisent des séquences très longues; les modèles au niveau des mots échouent sur les tokens hors vocabulaire et les variations morphologiques.

Trois algorithmes dominent : le codage par paires d'octets (BPE, Sennrich 2016) fusionne les paires d'octets les plus fréquentes de manière itérative jusqu'à atteindre la taille de vocabulaire cible — GPT-4 utilise cl100k avec 100 256 tokens. WordPiece (Schuster 2012) maximise la log-vraisemblance du corpus d'entraînement et est utilisé par les modèles de la famille BERT. SentencePiece (Kudo 2018) opère sur l'Unicode brut sans pré-tokenisation, le rendant agnostique à la langue — Llama 3 utilise un vocabulaire SentencePiece de 128 256 tokens. Les tokeniseurs sont entraînés séparément du modèle, puis gelés. Une particularité critique : la plupart des tokeniseurs divisent les nombres chiffre par chiffre (« 2024 » → ['20','24'] ou ['2','0','2','4']), rendant l'arithmétique fragile à moins que le modèle ne voie une quantité abondante de données d'entraînement numériques.

Pourquoi c'est important

  • cl100k de GPT-4 (100 256 tokens) vs SentencePiece de Llama 3 (128 256 tokens) ne sont pas interchangeables — mélanger les tokeniseurs produit des comptages de tokens silencieusement erronés et des dépassements de budget.
  • La gestion Unicode agnostique à la langue de SentencePiece compte directement pour les déploiements SAP multilingues (DACH, EMEA).
  • La particularité de découpage des chiffres (« 2024 » → ['20','24']) est une raison concrète de ne pas faire confiance à l'arithmétique des LLM dans les cas d'usage de reporting financier sans validation.

Points clés

  • BPE fusionne les paires d'octets fréquentes ; la table de fusion fait partie de l'artefact du modèle et doit être livrée avec lui.
  • GPT-4 cl100k : 100,256 tokens. Llama 3 SentencePiece : 128,256 tokens. Ne jamais supposer que les comptages de tokens sont interchangeables.
  • Le code ABAP se tokenise mal dans la plupart des vocabulaires entraînés en anglais — 1 ligne de code ABAP ≈ 8–15 tokens contre 3–5 pour Python.
  • Les nombres sont généralement découpés chiffre par chiffre ; demander aux modèles de produire les nombres sous forme de chaînes formatées quand la précision compte.
  • Tiktoken (OpenAI) et les tokenizers HuggingFace produisent tous deux des comptages ; toujours utiliser le tokenizer du modèle cible.
  • Tokenization n'est maîtrisé que lorsqu'il change une décision d'acheteur nommée.
  • Commencer par le contrat sémantique et le modèle de contrôle avant de démontrer l'outil.
  • Utiliser les signaux SAP, analystes, études, KG et actualité comme preuve, pas comme décoration.
  • Séparer les faits vérifiés des tendances directionnelles et des hypothèses modélisées.
  • Définir le propriétaire, la métrique, le seuil, le chemin de support et le plan de retour arrière avant de passer à l'échelle.

Termes employés sur cette page

BPE
Byte-Pair Encoding : fusionne itérativement les paires d'octets adjacentes les plus fréquentes dans le texte d'entraînement pour construire un vocabulaire de sous-mots.
Vocabulary
L'ensemble fixe d'identifiants de tokens avec lequel le modèle a été entraîné ; les entrées hors vocabulaire sont impossibles par construction en BPE — chaque octet est représentable.
SentencePiece
La bibliothèque de tokenisation de Google qui entraîne un modèle BPE ou unigram LM directement sur de l'Unicode brut, sans requérir de pré-tokenisation spécifique à la langue.
cl100k
Le vocabulaire BPE de 100 256 tokens d'OpenAI utilisé par GPT-4 et les modèles text-embedding-3, implémenté dans la bibliothèque tiktoken.
Token budget
Le nombre maximal de tokens (prompt + complétion) qu'un modèle peut traiter en un seul appel ; le dépasser déclenche une erreur de longueur de contexte.
Decision owner
La personne responsable qui assume l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, des indicateurs, des entités et des règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique la politique, les accès, la traçabilité, le monitoring et l'escalade à l'échelle du modèle opérationnel.

Sources

  1. Sennrich et al. 2016 — Neural Machine Translation of Rare Words with Subword Units (BPE)
  2. Kudo & Richardson 2018 — SentencePiece
  3. OpenAI tiktoken documentation
  4. OpenAI tokenizer playground
  5. Meta AI — Llama 3 Model Card
  6. HuggingFace tokenizers library
  7. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  8. SAP News Center — SAP Unveils the Autonomous Enterprise
  9. Stanford HAI — AI Index Report
  10. SAP Datasphere — Help Portal
  11. SAP Datasphere — official product page
  12. SAP Analytics Cloud — Help Portal
  13. SAP Analytics Cloud — official product page
  14. SAP BW/4HANA — Help Portal
  15. SAP S/4HANA — Help Portal
  16. SAP News Center
  17. SAP Community
  18. SAP — industries overview
  19. SAP Business AI — official product page
  20. SAP Joule (work companion) — official product page
  21. SAP Generative AI — official product page
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →