Tokenisierung und Embeddings in Enterprise-LLM-Pipelines
Stand 2026-07-24T14:00:00Z
Was ist Tokenisierung und Embeddings in Enterprise-LLM-Pipelines?
Entscheidungen bei der Tokenisierung treiben SAP-Prompt-Kosten unbemerkt in die Höhe und kürzen Dokumente — deutsche SAP-Begriffe kosten 20-40 % mehr Tokens als englische, und Chunking mit fester Token-Zahl kann einen Satz ohne Warnung mitten durchtrennen.
Worum es geht
Tokenisierung und Embeddings sind die beiden unsichtbaren Infrastrukturbausteine, die zwischen Rohtext und allem stehen, was ein großes Sprachmodell damit tut — und genau das sind die Bausteine, die unbemerkt bleiben, bis sie einen Kostensprung, eine stille Dokumentkürzung oder einen Retrieval-Fehler verursachen, der Joule weniger leistungsfähig erscheinen lässt, als es ist. Wer beides versteht, kann SAP-Wissenspipelines entwerfen, die schon beim ersten Versuch funktionieren statt erst beim dritten.
Warum es zählt
- SAP-spezifische und deutsche Komposita zerfallen in 8-12 Token gegenüber 2-3 bei englischen Entsprechungen, was die Kosten pro Aufruf direkt in die Höhe treibt.
- Zahlen tokenisieren ziffernweise, sodass Materialnummern und Kostenstellencodes die Token-Anzahl aufblähen und das arithmetische Schlussfolgern verschlechtern, sofern sie nicht vorverarbeitet werden.
- Chunking von SAP-PDF-Dokumentation an einer festen Grenze von 512 Token kürzt Sätze, die diese Grenze überschreiten, still — das Modell sieht die fehlende Hälfte nie.
Kernpunkte
- BPE-Vokabulargröße: GPT-4 verwendet ~100.000 Token; deutsche SAP-Komposita tokenisieren in 8-12 Token gegenüber 2-3 bei gleichwertigem Englisch — kalkulieren Sie +20-40 % Token für deutsche/SAP-Notation-Prompts ein.
- Zahlen tokenisieren in den meisten LLM-Vokabularen ziffernweise; SAP-Materialnummern und Kostenstellencodes blähen die Token-Anzahl auf und verschlechtern das arithmetische Schlussfolgern — wo möglich vorverarbeiten.
- Kürzung ist still: SAP-Dokumente immer an Satz- oder Absatzgrenzen in Chunks zerlegen, niemals bei fester Token-Zahl, um ein Zerschneiden mitten im Satz zu vermeiden.
- Embeddings (768-4096 Dimensionen) gruppieren semantisch ähnliche Texte; ermöglichen synonymtolerantes Retrieval („Kostenobjekt“ = „Controlling-Objekt“), das die Stichwortsuche übersieht.
- Die HANA Cloud Vector Engine (allgemein verfügbar seit 2024) speichert und befragt Embeddings nativ neben relationalen Daten — für die meisten SAP-Implementierungen ist keine separate Vektordatenbank nötig.
- SAP-domänenangepasste Embedding-Modelle auf AI Core übertreffen generische OpenAI-Embeddings um 8-15 % bei Recall@5 auf SAP-Help-Portal-Retrieval-Aufgaben.
- Tokenisierung und Embeddings in Enterprise-LLM-Pipelines ist erst dann beherrscht, wenn es eine konkret benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und Nachrichtensignale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
Begriffe auf dieser Seite
- BPE (Byte-Pair Encoding)
- Subword-Tokenisierungsalgorithmus, der iterativ die häufigsten benachbarten Zeichenpaare verschmilzt, bis eine Ziel-Vokabulargröße erreicht ist.
- Embedding
- Dichte Vektorrepräsentation von Text, bei der semantisch ähnliche Texte im hochdimensionalen Raum eng beieinanderliegen; Grundlage semantischer Suche und RAG-Retrieval.
- HANA Cloud Vector Engine
- Native Vektorspeicherung und Approximate-Nearest-Neighbour-Suche (HNSW) in SAP HANA Cloud (allgemein verfügbar seit 2024), die embedding-basiertes Retrieval ohne separate Vektordatenbank ermöglicht.
- Recall@k
- Retrieval-Qualitätskennzahl: Anteil der relevanten Dokumente, die in den Top-k-Ergebnissen gefunden werden; Standard-Benchmark zur Bewertung von RAG-Pipelines.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Kompromiss akzeptiert und die nächste Aktion finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg anwendet.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.
Quellen
- SAP HANA Cloud Vector Engine documentation
- SAP AI Core — embedding models on BTP
- Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units (BPE, 2016)
- OpenAI tiktoken tokeniser
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.