Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix

Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix?

Die 20-Tokens-pro-Parameter-Regel des Chinchilla-Skalierungsgesetzes bedeutet, dass ein 70-Milliarden-Parameter-Modell über 1,4 Billionen Trainings-Tokens benötigt, und Spitzenmodelle heute 10 bis 15 Billionen benötigen — womit die fünfstufige Kuratierungs-Pipeline das eigentliche Produkt hinter jedem Spitzenmodell ist.

Worum es geht

Die Kuratierung von Pretraining-Daten ist die Grundlagenphase beim Bau jedes großen Sprachmodells und wohl die folgenreichste, zugleich am wenigsten sichtbare. Bevor auch nur ein einziger Trainingsschritt läuft, verbringen Teams Monate damit, die Billionen Tokens zusammenzustellen, zu filtern, zu deduplizieren und neu auszubalancieren, die dauerhaft das Vokabular, den Reasoning-Stil, die faktische Fundierung und die blinden Flecken eines Modells prägen werden. Alles Nachgelagerte — Instruction Tuning, RLHF, Deployment-Verhalten — erbt die Verzerrungen und Lücken des Korpus. Für jeden, der einen Kunden bei der Wahl des Foundation-Modells für Joule oder einen BDC-gestützten Agenten berät, ist das Verständnis dessen, was in den Korpus eingeflossen ist, keine akademische Nebensächlichkeit — es ist der Unterschied zwischen einer informierten Modellauswahl-Entscheidung und einer marketinggetriebenen.

Warum es zählt

  • Common Crawl liefert 250 Mrd.+ Rohseiten, ist aber roh unbrauchbar — die CCNet-, C4- und RefinedWeb-Pipelines entfernen 90-95 % der Rohbytes, bevor es trainierbar ist.
  • Deduplizierung via MinHash + LSH entfernt typischerweise 30-50 % des Rohkorpus auf Dokument- und Absatzebene, und Dekontaminierung entfernt explizit Benchmark-Testsätze (MMLU, HumanEval, GSM8K), um Eval-Leckage zu verhindern.
  • Domänen-Rebalancing gewichtet rohen Web-Text bewusst geringer und Bücher/Code/Papers stärker — die Chinchilla-Mischung selbst bestand zu 67 % aus Web plus 33 % hochwertigen Quellen —, um die Reasoning-Qualität zu heben.

Kernpunkte

  • Chinchilla-Skalierung — rechenoptimal ≈ 20 Tokens/Parameter; ein 70B-Modell benötigt 1,4 Bio.+ Tokens, Spitzenmodelle inzwischen 10-15 Bio.
  • Drei Quellen — Common Crawl (offenes Web, 90-95 % herausgefiltert) + The Pile / RedPajama / FineWeb (kuratierte Forschungsmischung) + proprietär (lizenzierte Bücher, Code, synthetisch).
  • Fünfstufige Pipeline — Qualitätsfilter, Deduplizierung (MinHash+LSH, entfernt 30-50 %), Toxizität/PII, Domänen-Rebalancing, Benchmark-Dekontaminierung.
  • Die Domänenmischung entscheidet über die nachgelagerte Fähigkeit — codelastige Mischungen heben das Reasoning; SAP-arme Mischungen garantieren Halluzination in der SAP-Domäne.
  • Anti-Pattern — anzunehmen, ein LLM 'kenne' proprietäre oder aktuelle Inhalte; war es nicht vor dem Trainings-Cutoff im Korpus, ist es nicht da.
  • Kuratierung von Pretraining-Daten — Common Crawl, The Pile, proprietärer Mix ist erst beherrscht, wenn es eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, KG- und News-Signale als Beleg, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Chinchilla scaling law
Empirisches Ergebnis von DeepMind (Hoffmann et al. 2022), das zeigt, dass rechenoptimales LLM-Training rund 20 Trainings-Tokens pro Modellparameter benötigt; hat das Feld weg von überparametrisierten, untertrainierten Modellen verschoben.
Common Crawl
Gemeinnütziger offener Web-Scrape, seit 2008 monatlich veröffentlicht; 250 Mrd.+ Seiten rohes HTML; die größte Einzelquelle in fast jedem LLM-Pretraining-Korpus, erfordert aber vor der Nutzung 90-95 % Filterung.
The Pile
825-GB-offener Forschungskorpus, 2020 von EleutherAI veröffentlicht, mischt Common Crawl, Bücher, PubMed, ArXiv, GitHub, StackExchange, Wikipedia in deklarierten Proportionen; 2024-2025 von SlimPajama, RedPajama-v2, FineWeb abgelöst.
Decontamination
Die Pipeline-Stufe, die Benchmark-Evaluationstestsätze (MMLU, HumanEval, GSM8K) explizit aus dem Trainingskorpus entfernt, um Eval-Leckage und aufgeblähte gemeldete Scores zu verhindern.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Vertrag
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Ebene, die Richtlinien, Zugriff, Herkunftsnachweis (Lineage), Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen voneinander unterscheidet.

Quellen

  1. Hoffmann et al. — Training Compute-Optimal Large Language Models (Chinchilla, DeepMind 2022)
  2. Gao et al. — The Pile: An 800GB Dataset of Diverse Text for Language Modeling (EleutherAI 2020)
  3. Penedo et al. — The RefinedWeb Dataset for Falcon LLM (2023)
  4. HuggingFace — FineWeb dataset card and curation methodology
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →