Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Tokenisierung und Embeddings in Enterprise-LLM-Pipelines

Tokenisierung und Embeddings in Enterprise-LLM-Pipelines — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Tokenisierung und Embeddings in Enterprise-LLM-Pipelines?

Entscheidungen bei der Tokenisierung treiben SAP-Prompt-Kosten unbemerkt in die Höhe und kürzen Dokumente — deutsche SAP-Begriffe kosten 20-40 % mehr Tokens als englische, und Chunking mit fester Token-Zahl kann einen Satz ohne Warnung mitten durchtrennen.

Worum es geht

Tokenisierung und Embeddings sind die beiden unsichtbaren Infrastrukturbausteine, die zwischen Rohtext und allem stehen, was ein großes Sprachmodell damit tut — und genau das sind die Bausteine, die unbemerkt bleiben, bis sie einen Kostensprung, eine stille Dokumentkürzung oder einen Retrieval-Fehler verursachen, der Joule weniger leistungsfähig erscheinen lässt, als es ist. Wer beides versteht, kann SAP-Wissenspipelines entwerfen, die schon beim ersten Versuch funktionieren statt erst beim dritten.

Warum es zählt

  • SAP-spezifische und deutsche Komposita zerfallen in 8-12 Token gegenüber 2-3 bei englischen Entsprechungen, was die Kosten pro Aufruf direkt in die Höhe treibt.
  • Zahlen tokenisieren ziffernweise, sodass Materialnummern und Kostenstellencodes die Token-Anzahl aufblähen und das arithmetische Schlussfolgern verschlechtern, sofern sie nicht vorverarbeitet werden.
  • Chunking von SAP-PDF-Dokumentation an einer festen Grenze von 512 Token kürzt Sätze, die diese Grenze überschreiten, still — das Modell sieht die fehlende Hälfte nie.

Kernpunkte

  • BPE-Vokabulargröße: GPT-4 verwendet ~100.000 Token; deutsche SAP-Komposita tokenisieren in 8-12 Token gegenüber 2-3 bei gleichwertigem Englisch — kalkulieren Sie +20-40 % Token für deutsche/SAP-Notation-Prompts ein.
  • Zahlen tokenisieren in den meisten LLM-Vokabularen ziffernweise; SAP-Materialnummern und Kostenstellencodes blähen die Token-Anzahl auf und verschlechtern das arithmetische Schlussfolgern — wo möglich vorverarbeiten.
  • Kürzung ist still: SAP-Dokumente immer an Satz- oder Absatzgrenzen in Chunks zerlegen, niemals bei fester Token-Zahl, um ein Zerschneiden mitten im Satz zu vermeiden.
  • Embeddings (768-4096 Dimensionen) gruppieren semantisch ähnliche Texte; ermöglichen synonymtolerantes Retrieval („Kostenobjekt“ = „Controlling-Objekt“), das die Stichwortsuche übersieht.
  • Die HANA Cloud Vector Engine (allgemein verfügbar seit 2024) speichert und befragt Embeddings nativ neben relationalen Daten — für die meisten SAP-Implementierungen ist keine separate Vektordatenbank nötig.
  • SAP-domänenangepasste Embedding-Modelle auf AI Core übertreffen generische OpenAI-Embeddings um 8-15 % bei Recall@5 auf SAP-Help-Portal-Retrieval-Aufgaben.
  • Tokenisierung und Embeddings in Enterprise-LLM-Pipelines ist erst dann beherrscht, wenn es eine konkret benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und Nachrichtensignale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.

Begriffe auf dieser Seite

BPE (Byte-Pair Encoding)
Subword-Tokenisierungsalgorithmus, der iterativ die häufigsten benachbarten Zeichenpaare verschmilzt, bis eine Ziel-Vokabulargröße erreicht ist.
Embedding
Dichte Vektorrepräsentation von Text, bei der semantisch ähnliche Texte im hochdimensionalen Raum eng beieinanderliegen; Grundlage semantischer Suche und RAG-Retrieval.
HANA Cloud Vector Engine
Native Vektorspeicherung und Approximate-Nearest-Neighbour-Suche (HNSW) in SAP HANA Cloud (allgemein verfügbar seit 2024), die embedding-basiertes Retrieval ohne separate Vektordatenbank ermöglicht.
Recall@k
Retrieval-Qualitätskennzahl: Anteil der relevanten Dokumente, die in den Top-k-Ergebnissen gefunden werden; Standard-Benchmark zur Bewertung von RAG-Pipelines.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Aktion finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg anwendet.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.

Quellen

  1. SAP HANA Cloud Vector Engine documentation
  2. SAP AI Core — embedding models on BTP
  3. Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units (BPE, 2016)
  4. OpenAI tiktoken tokeniser
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →