Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix
Stand 2026-07-24T14:00:00Z
Was ist Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix?
Die 20-Tokens-pro-Parameter-Regel des Chinchilla-Skalierungsgesetzes bedeutet, dass ein 70-Milliarden-Parameter-Modell über 1,4 Billionen Trainings-Tokens benötigt, und Spitzenmodelle heute 10 bis 15 Billionen benötigen — womit die fünfstufige Kuratierungs-Pipeline das eigentliche Produkt hinter jedem Spitzenmodell ist.
Worum es geht
Die Kuratierung von Pretraining-Daten ist die Grundlagenphase beim Bau jedes großen Sprachmodells und wohl die folgenreichste, zugleich am wenigsten sichtbare. Bevor auch nur ein einziger Trainingsschritt läuft, verbringen Teams Monate damit, die Billionen Tokens zusammenzustellen, zu filtern, zu deduplizieren und neu auszubalancieren, die dauerhaft das Vokabular, den Reasoning-Stil, die faktische Fundierung und die blinden Flecken eines Modells prägen werden. Alles Nachgelagerte — Instruction Tuning, RLHF, Deployment-Verhalten — erbt die Verzerrungen und Lücken des Korpus. Für jeden, der einen Kunden bei der Wahl des Foundation-Modells für Joule oder einen BDC-gestützten Agenten berät, ist das Verständnis dessen, was in den Korpus eingeflossen ist, keine akademische Nebensächlichkeit — es ist der Unterschied zwischen einer informierten Modellauswahl-Entscheidung und einer marketinggetriebenen.
Warum es zählt
- Common Crawl liefert 250 Mrd.+ Rohseiten, ist aber roh unbrauchbar — die CCNet-, C4- und RefinedWeb-Pipelines entfernen 90-95 % der Rohbytes, bevor es trainierbar ist.
- Deduplizierung via MinHash + LSH entfernt typischerweise 30-50 % des Rohkorpus auf Dokument- und Absatzebene, und Dekontaminierung entfernt explizit Benchmark-Testsätze (MMLU, HumanEval, GSM8K), um Eval-Leckage zu verhindern.
- Domänen-Rebalancing gewichtet rohen Web-Text bewusst geringer und Bücher/Code/Papers stärker — die Chinchilla-Mischung selbst bestand zu 67 % aus Web plus 33 % hochwertigen Quellen —, um die Reasoning-Qualität zu heben.
Kernpunkte
- Chinchilla-Skalierung — rechenoptimal ≈ 20 Tokens/Parameter; ein 70B-Modell benötigt 1,4 Bio.+ Tokens, Spitzenmodelle inzwischen 10-15 Bio.
- Drei Quellen — Common Crawl (offenes Web, 90-95 % herausgefiltert) + The Pile / RedPajama / FineWeb (kuratierte Forschungsmischung) + proprietär (lizenzierte Bücher, Code, synthetisch).
- Fünfstufige Pipeline — Qualitätsfilter, Deduplizierung (MinHash+LSH, entfernt 30-50 %), Toxizität/PII, Domänen-Rebalancing, Benchmark-Dekontaminierung.
- Die Domänenmischung entscheidet über die nachgelagerte Fähigkeit — codelastige Mischungen heben das Reasoning; SAP-arme Mischungen garantieren Halluzination in der SAP-Domäne.
- Anti-Pattern — anzunehmen, ein LLM 'kenne' proprietäre oder aktuelle Inhalte; war es nicht vor dem Trainings-Cutoff im Korpus, ist es nicht da.
- Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix ist erst beherrscht, wenn es eine benannte Käuferentscheidung verändert.
- Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
- Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Chinchilla scaling law
- Empirisches Ergebnis von DeepMind (Hoffmann et al. 2022), das zeigt, dass rechenoptimales LLM-Training rund 20 Trainings-Tokens pro Modellparameter benötigt; hat das Feld weg von überparametrisierten, untertrainierten Modellen verschoben.
- Common Crawl
- Gemeinnütziger offener Web-Scrape, seit 2008 monatlich veröffentlicht; 250 Mrd.+ Seiten rohes HTML; die größte Einzelquelle in fast jedem LLM-Pretraining-Korpus, erfordert aber vor der Nutzung 90-95 % Filterung.
- The Pile
- 825-GB-offener Forschungskorpus, 2020 von EleutherAI veröffentlicht, mischt Common Crawl, Bücher, PubMed, ArXiv, GitHub, StackExchange, Wikipedia in deklarierten Proportionen; 2024-2025 von SlimPajama, RedPajama-v2, FineWeb abgelöst.
- Decontamination
- Die Pipeline-Stufe, die Benchmark-Evaluationstestsätze (MMLU, HumanEval, GSM8K) explizit aus dem Trainingskorpus entfernt, um Eval-Leckage und aufgeblähte gemeldete Scores zu verhindern.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Vertrag
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Ebene, die Richtlinien, Zugriff, Herkunftsnachweis (Lineage), Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.
Quellen
- Hoffmann et al. — Training Compute-Optimal Large Language Models (Chinchilla, DeepMind 2022)
- Gao et al. — The Pile: An 800GB Dataset of Diverse Text for Language Modeling (EleutherAI 2020)
- Penedo et al. — The RefinedWeb Dataset for Falcon LLM (2023)
- HuggingFace — FineWeb dataset card and curation methodology
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.