Curation des données de pré-entraînement — Common Crawl, The Pile, mix propriétaire
À jour au 2026-07-24T14:00:00Z
Qu'est-ce que Curation des données de pré-entraînement — Common Crawl, The Pile, mix propriétaire ?
La règle Chinchilla de 20 tokens par paramètre signifie qu'un modèle 70B nécessite 1,4 T+ tokens d'entraînement, et les modèles frontière en exigent désormais 10-15 T — faisant du pipeline de curation en cinq étapes le vrai produit derrière tout modèle frontière.
La curation des données de pré-entraînement est la phase fondatrice de la construction de tout grand modèle de langage, et sans doute la plus déterminante bien que la moins visible. Avant même le premier pas d'entraînement, les équipes passent des mois à rassembler, filtrer, dédupliquer et rééquilibrer les milliers de milliards de tokens qui façonneront durablement le vocabulaire, le style de raisonnement, l'ancrage factuel et les angles morts du modèle. Tout ce qui vient ensuite — l'ajustement par instructions, le RLHF, le comportement en production — hérite des biais et des lacunes du corpus. Pour quiconque conseille un client sur le choix d'un modèle de fondation à intégrer dans Joule ou dans un agent ancré sur BDC, comprendre ce qui compose ce corpus n'est pas un détail académique : c'est ce qui distingue une décision de sélection de modèle informée d'une décision dictée par le marketing.
Les trois familles de sources
Pourquoi c'est important
- Common Crawl fournit 250 G+ pages brutes mais est inutilisable tel quel — les pipelines CCNet, C4 et RefinedWeb éliminent 90-95 % des octets bruts avant que ce soit entraînable.
- La déduplication par MinHash + LSH retire typiquement 30-50 % du corpus brut au niveau document et paragraphe, et la décontamination retire explicitement les jeux de test des benchmarks (MMLU, HumanEval, GSM8K) pour prévenir la fuite d'évaluation.
- Le rééquilibrage de domaine sous-pondère délibérément le texte web brut et sur-pondère livres/code/papiers — le mix Chinchilla lui-même était 67 % web plus 33 % sources de haute qualité — pour élever la qualité de raisonnement.
Points clés
- Échelle Chinchilla — compute-optimal ≈ 20 tokens/paramètre ; modèle 70B = 1,4 T+ tokens, frontière actuelle 10 T-15 T.
- Trois sources — Common Crawl (web ouvert, 90-95 % filtré) + The Pile / RedPajama / FineWeb (mix recherche curé) + propriétaire (livres sous licence, code, synthétique).
- Pipeline cinq étapes — filtre qualité, déduplication (MinHash+LSH, retire 30-50 %), toxicité/PII, rééquilibrage domaine, décontamination benchmark.
- Le mix de domaine décide de la capacité aval — mix lourd en code lève le raisonnement ; mix léger SAP garantit l'hallucination domaine SAP.
- Anti-pattern — supposer qu'un LLM « connaît » du contenu propriétaire ou récent ; s'il n'était pas dans le corpus avant la coupure d'entraînement, il n'y est pas.
Termes employés sur cette page
- Chinchilla scaling law
- Résultat empirique de DeepMind (Hoffmann et al. 2022) montrant qu'un entraînement de LLM optimal en compute requiert environ 20 tokens d'entraînement par paramètre du modèle ; a réorienté le domaine loin des modèles surparamétrés et sous-entraînés.
- Common Crawl
- Moisson ouverte du web par une organisation à but non lucratif, publiée mensuellement depuis 2008 ; plus de 250 milliards de pages de HTML brut ; la plus grande source unique de presque tous les corpus de pré-entraînement de LLM, mais qui exige un filtrage de 90 à 95 % avant usage.
- The Pile
- Corpus de recherche ouvert de 825 Go publié par EleutherAI en 2020, mêlant Common Crawl, livres, PubMed, ArXiv, GitHub, StackExchange et Wikipedia dans des proportions déclarées ; supplanté par SlimPajama, RedPajama-v2 et FineWeb en 2024-2025.
- Decontamination
- L'étape du pipeline qui retire explicitement les jeux de test d'évaluation de référence (MMLU, HumanEval, GSM8K) du corpus d'entraînement afin de prévenir la fuite d'évaluation et le gonflement des scores rapportés.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
- Evidence grade
- Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- Hoffmann et al. — Training Compute-Optimal Large Language Models (Chinchilla, DeepMind 2022)
- Gao et al. — The Pile: An 800GB Dataset of Diverse Text for Language Modeling (EleutherAI 2020)
- Penedo et al. — The RefinedWeb Dataset for Falcon LLM (2023)
- HuggingFace — FineWeb dataset card and curation methodology
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.