Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Tokenisierung

Tokenisierung — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist Tokenisierung?

Die Wahl des Tokenizers legt stillschweigend das effektive Vokabular eines Modells, seine Mehrsprachigkeit und die API-Kosten fest — und die ziffernweise Aufspaltung von Zahlen ist die konkrete Eigenheit, die LLM-Arithmetik ohne umfangreiche numerische Trainingsdaten unzuverlässig macht.

Worum es geht

Tokenisierung ist der Prozess, rohen Text in eine Sequenz ganzzahliger IDs umzuwandeln, die ein LLM verarbeiten kann. Sie ist kein Vorverarbeitungsdetail — sie legt das effektive Vokabular des Modells fest, seinen Umgang mit seltenen Wörtern, seine mehrsprachige Leistung und treibt direkt die API-Kosten.

Das Kernproblem, das sie löst, ist die Darstellung eines offenen Zeichenkettenraums mit einer festgrößigen Embedding-Tabelle bei gleichzeitig handhabbaren Sequenzlängen. Modelle auf Zeichenebene erzeugen sehr lange Sequenzen; Modelle auf Wortebene versagen bei Token außerhalb des Vokabulars und bei morphologischer Variation.

Drei Algorithmen dominieren: Byte-Pair Encoding (BPE, Sennrich 2016) verschmilzt iterativ die häufigsten Byte-Paare, bis die Zielvokabulargröße erreicht ist — GPT-4 verwendet cl100k mit 100.256 Token. WordPiece (Schuster 2012) maximiert die Log-Likelihood des Trainingskorpus und wird von Modellen der BERT-Familie verwendet. SentencePiece (Kudo 2018) arbeitet auf rohem Unicode ohne Vor-Tokenisierung und ist damit sprachunabhängig — Llama 3 verwendet ein SentencePiece-Vokabular mit 128.256 Token. Tokenizer werden separat vom Modell trainiert und dann eingefroren. Eine kritische Eigenheit: Die meisten Tokenizer spalten Zahlen ziffernweise auf ('2024' → ['20','24'] oder ['2','0','2','4']), was Arithmetik brüchig macht, sofern das Modell nicht reichlich numerische Trainingsdaten sieht.

Wählen Sie cl100k (tiktoken), wenn Sie auf OpenAI-Modellen aufbauen; verwenden Sie sonst den mitgelieferten Tokenizer des Modells — mischen Sie Tokenizer niemals. Nicht zueinander passende Tokenizer erzeugen stillschweigend falsche Token-Zahlen und Budgetüberschreitungen.

Warum es zählt

  • GPT-4s cl100k (100.256 Token) und Llama 3s SentencePiece (128.256 Token) sind nicht austauschbar — das Mischen von Tokenizern erzeugt stillschweigend falsche Token-Zahlen und Budgetüberschreitungen.
  • Die sprachunabhängige Unicode-Behandlung von SentencePiece ist direkt relevant für mehrsprachige SAP-Deployments (DACH, EMEA).
  • Die Eigenheit der Ziffernaufspaltung ('2024' → ['20','24']) ist ein konkreter Grund, LLM-Arithmetik in Finanzberichts-Use-Cases ohne Validierung zu misstrauen.

Kernpunkte

  • BPE verschmilzt häufige Byte-Paare; die Merge-Tabelle ist Teil des Modell-Artefakts und muss mit ihm ausgeliefert werden.
  • GPT-4 cl100k: 100.256 Token. Llama 3 SentencePiece: 128.256 Token. Nehmen Sie niemals an, Token-Zahlen seien austauschbar.
  • ABAP-Code tokenisiert in den meisten englisch trainierten Vokabularen schlecht — 1 ABAP-LOC ≈ 8–15 Token gegenüber 3–5 bei Python.
  • Zahlen werden meist ziffernweise aufgespalten; weisen Sie Modelle an, Zahlen als formatierte Zeichenketten auszugeben, wenn Präzision zählt.
  • Tiktoken (OpenAI) und HuggingFace-Tokenizer liefern beide Zählungen; verwenden Sie stets den Tokenizer des Zielmodells.
  • Tokenisierung ist erst beherrscht, wenn sie eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback vor der Skalierung.

Begriffe auf dieser Seite

BPE
Byte-Pair Encoding: verschmilzt iterativ die häufigsten benachbarten Byte-Paare im Trainingstext, um ein Subwort-Vokabular aufzubauen.
Vocabulary
Die feste Menge von Token-IDs, mit denen das Modell trainiert wurde; Eingaben außerhalb des Vokabulars sind bei BPE konstruktionsbedingt unmöglich — jedes Byte ist darstellbar.
SentencePiece
Googles Tokenizer-Bibliothek, die ein BPE- oder Unigramm-LM-Modell direkt auf rohem Unicode trainiert und keine sprachspezifische Vor-Tokenisierung benötigt.
cl100k
OpenAIs BPE-Vokabular mit 100.256 Token, verwendet von GPT-4 und text-embedding-3-Modellen, implementiert in der tiktoken-Bibliothek.
Token budget
Die maximale Anzahl von Token (Prompt + Completion), die ein Modell in einem Aufruf verarbeiten kann; eine Überschreitung löst einen Kontextlängenfehler aus.
Decision owner
Die verantwortliche Person, die den Zielkonflikt akzeptiert und die nächste Maßnahme finanziert.
Semantic contract
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control plane
Die Schicht, die Policy, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.

Quellen

  1. Sennrich et al. 2016 — Neural Machine Translation of Rare Words with Subword Units (BPE)
  2. Kudo & Richardson 2018 — SentencePiece
  3. OpenAI tiktoken documentation
  4. OpenAI tokenizer playground
  5. Meta AI — Llama 3 Model Card
  6. HuggingFace tokenizers library
  7. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  8. SAP News Center — SAP Unveils the Autonomous Enterprise
  9. Stanford HAI — AI Index Report
  10. SAP Datasphere — Help Portal
  11. SAP Datasphere — official product page
  12. SAP Analytics Cloud — Help Portal
  13. SAP Analytics Cloud — official product page
  14. SAP BW/4HANA — Help Portal
  15. SAP S/4HANA — Help Portal
  16. SAP News Center
  17. SAP Community
  18. SAP — industries overview
  19. SAP Business AI — official product page
  20. SAP Joule (work companion) — official product page
  21. SAP Generative AI — official product page
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →