Curation des données de pré-entraînement — Common Crawl, The Pile, mix propriétaire
À jour au 2026-10-09
Qu'est-ce que Curation des données de pré-entraînement ?
La règle Chinchilla de 20 tokens par paramètre signifie qu'un modèle 70B nécessite 1,4 T+ tokens d'entraînement, et les modèles frontière en exigent désormais 10-15 T — faisant du pipeline de curation en cinq étapes le vrai produit derrière tout modèle frontière.
De quoi il s'agit
La curation des données de pré-entraînement est la phase fondatrice de la construction de tout grand modèle de langage, et sans doute la plus déterminante bien que la moins visible. Avant même le premier pas d'entraînement, les équipes passent des mois à rassembler, filtrer, dédupliquer et rééquilibrer les milliers de milliards de tokens qui façonneront durablement le vocabulaire, le style de raisonnement, l'ancrage factuel et les angles morts du modèle. Tout ce qui vient ensuite — l'ajustement par instructions, le RLHF, le comportement en production — hérite des biais et des lacunes du corpus. Pour quiconque conseille un client sur le choix d'un modèle de fondation à intégrer dans Joule ou dans un agent ancré sur BDC, comprendre ce qui compose ce corpus n'est pas un détail académique : c'est ce qui distingue une décision de sélection de modèle informée d'une décision dictée par le marketing.
Pourquoi c'est important
- Common Crawl fournit 250 G+ pages brutes mais est inutilisable tel quel — les pipelines CCNet, C4 et RefinedWeb éliminent 90-95 % des octets bruts avant que ce soit entraînable.
- La déduplication par MinHash + LSH retire typiquement 30-50 % du corpus brut au niveau document et paragraphe, et la décontamination retire explicitement les jeux de test des benchmarks (MMLU, HumanEval, GSM8K) pour prévenir la fuite d'évaluation.
- Le rééquilibrage de domaine sous-pondère délibérément le texte web brut et sur-pondère livres/code/papiers — le mix Chinchilla lui-même était 67 % web plus 33 % sources de haute qualité — pour élever la qualité de raisonnement.
Points clés
- Échelle Chinchilla — compute-optimal ≈ 20 tokens/paramètre ; modèle 70B = 1,4 T+ tokens, frontière actuelle 10 T-15 T.
- Trois sources — Common Crawl (web ouvert, 90-95 % filtré) + The Pile / RedPajama / FineWeb (mix recherche curé) + propriétaire (livres sous licence, code, synthétique).
- Pipeline cinq étapes — filtre qualité, déduplication (MinHash+LSH, retire 30-50 %), toxicité/PII, rééquilibrage domaine, décontamination benchmark.
- Le mix de domaine décide de la capacité aval — mix lourd en code lève le raisonnement ; mix léger SAP garantit l'hallucination domaine SAP.
- Anti-pattern — supposer qu'un LLM « connaît » du contenu propriétaire ou récent ; s'il n'était pas dans le corpus avant la coupure d'entraînement, il n'y est pas.
- Les SAP Domain Models (SAP-ABAP-2, variantes S/4HANA/Ariba) règlent l'écart de vocabulaire SAP via un entraînement continué sur le propre corpus de SAP, pas un pré-entraînement depuis zéro — Early Adopter Care aujourd'hui, GA ciblée T3 2026, pas encore un livrable engagé.
- SAP-RPT et TabPFN contournent toute cette discussion — ils prédisent via l'apprentissage en contexte à partir d'une table fournie à l'inférence, sans aucune étape d'assemblage de corpus de pré-entraînement ; ne pas appliquer le cadre de cette fiche à cette famille de produits.
Termes employés sur cette page
- Chinchilla scaling law
- Résultat empirique de DeepMind (Hoffmann et al. 2022) montrant qu'un entraînement de LLM optimal en compute requiert environ 20 tokens d'entraînement par paramètre du modèle ; a réorienté le domaine loin des modèles surparamétrés et sous-entraînés.
- Common Crawl
- Moisson ouverte du web par une organisation à but non lucratif, publiée mensuellement depuis 2008 ; plus de 250 milliards de pages de HTML brut ; la plus grande source unique de presque tous les corpus de pré-entraînement de LLM, mais qui exige un filtrage de 90 à 95 % avant usage.
- The Pile
- Corpus de recherche ouvert de 825 Go publié par EleutherAI en 2020, mêlant Common Crawl, livres, PubMed, ArXiv, GitHub, StackExchange et Wikipedia dans des proportions déclarées ; supplanté par SlimPajama, RedPajama-v2 et FineWeb en 2024-2025.
- Decontamination
- L'étape du pipeline qui retire explicitement les jeux de test d'évaluation de référence (MMLU, HumanEval, GSM8K) du corpus d'entraînement afin de prévenir la fuite d'évaluation et le gonflement des scores rapportés.
- RedPajama-V2
- Le corpus successeur d'octobre 2023 de Together Computer : plus de 100 milliards de documents issus de 84 instantanés Common Crawl, une partition dédupliquée head_middle d'environ 20,8 milliards de documents (~30,4 T tokens sur cinq langues), avec des annotations de signaux de qualité publiées (nombre de mots, répétitivité, toxicité) permettant un filtrage personnalisable (huggingface.co, vérifié le 27/09/2026).
- Corpus des SAP Domain Models
- Le corpus d'entraînement continué propre à SAP (code ABAP, documentation et contenu de processus S/4HANA, données Ariba) superposé à un modèle de fondation existant pour produire SAP-ABAP-2 et les variantes spécialisées S/4HANA/Ariba tournant sous Joule/Joule Studio ; Early Adopter Care aujourd'hui, GA ciblée T3 2026 — un mélange dense en domaine, pas un pré-entraînement depuis zéro à l'échelle de Common Crawl.
Sources
- Hoffmann et al. — Training Compute-Optimal Large Language Models (Chinchilla, DeepMind 2022)
- Gao et al. — The Pile: An 800GB Dataset of Diverse Text for Language Modeling (EleutherAI 2020)
- Penedo et al. — The RefinedWeb Dataset for Falcon LLM (2023)
- HuggingFace — FineWeb dataset card and curation methodology
- SAP Business AI — official product page
- SAP Generative AI — official product page
- Hugging Face — RedPajama-Data-V2 dataset card, size and filtering methodology (checked 2026-09-27)
- SAP News Center — Joule Studio, enterprise-scale agentic development (SAP Domain Models context, 2026-05-13)
- SAP Learning — reference architecture, SAP Domain Models under Joule/Joule Studio
- SAP — SAP-RPT tabular foundation model product page (contrast with pre-training-corpus discussion)
- Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research — Soldaini et al., arXiv
- DataComp-LM: In search of the next generation of training sets for language models — Li et al., arXiv
- Deduplicating Training Data Makes Language Models Better — Lee et al., arXiv
- Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (C4) — Raffel et al., arXiv
- The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale — Penedo et al., arXiv
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.