Pré-entraînement continu — Adaptation au domaine sans oubli
À jour au 2026-07-23
Qu'est-ce que Pré-entraînement continu — Adaptation au domaine sans oubli ?
Le pré-entraînement continu injecte des milliards de tokens de domaine dans un modèle de fondation pour en intérioriser le dialecte avant tout fine-tuning de tâche — mais risque l'oubli catastrophique sans tampons de relecture, taux d'apprentissage faibles et masquage de perte.
De quoi il s'agit
Le pré-entraînement continu (CPT) consiste à prendre un modèle de fondation déjà pré-entraîné — Llama-3, Mistral, Qwen ou un modèle frontière fermé exposé via API de fine-tuning — et à lui injecter plusieurs milliards de tokens supplémentaires issus d'un domaine cible, afin que le modèle intériorise le vocabulaire, les idiomes et les schémas de raisonnement de ce domaine avant tout fine-tuning spécifique à une tâche. Pour l'analytique SAP, le corpus cible est un mélange curé de SAP Help Portal, de notes OSS, de code ABAP et SQL HANA, de fils SAP Community et de documentation d'implémentation client.
Le risque central est l'oubli catastrophique — le phénomène où le nouvel entraînement déplace les poids au point que le modèle perd les capacités générales qu'il avait initialement (mathématiques, raisonnement multilingue, suivi d'instructions). Trois garde-fous dominent la littérature. Les tampons de relecture (replay buffers) réinjectent 5-15 % de la distribution de pré-entraînement initiale à chaque batch CPT pour ancrer la distribution générale. Les taux d'apprentissage faibles (1e-5 à 5e-5 contre 1e-4 pour un pré-entraînement from-scratch) maintiennent les mises à jour de poids petites. Le masquage de perte sur les tokens système et les marqueurs d'instruction réservés évite le sur-apprentissage des artefacts de formatage.
Pourquoi c'est important
- Trois garde-fous concrets préviennent l'oubli : relecture de 5-15 % des données de pré-entraînement d'origine par batch, taux d'apprentissage 1e-5 à 5e-5 (contre 1e-4 from-scratch), et masquage de perte sur les tokens système/instruction.
- La plupart des projets CPT échouent sur le pipeline de données, pas la boucle d'entraînement — déduplication (MinHash/SemDeDup) et filtrage qualité par perplexité sont non négociables.
- La règle de décision est explicite : recourir au CPT avec 10 Md+ tokens de dialecte de domaine (ABAP SAP, juridique, biomédical) ; recourir au LoRA (C258) avec seulement 10 K-10 M exemples de tâche.
Points clés
- Procédure — injecter 10 à 100 milliards de tokens de texte du domaine dans un modèle pré-entraîné avec un taux d'apprentissage faible (1e-5 à 5e-5) avant tout fine-tuning de tâche.
- Oubli catastrophique — le risque principal ; mitigé par les replay buffers (5-15 % de distribution initiale), un LR bas et le masquage de perte sur tokens système.
- Pipeline de données — déduplication MinHash/SemDeDup, filtrage qualité par perplexité, nettoyage PII, traçabilité Art. 10 du règlement IA obligatoires.
- Quand l'utiliser — le domaine a un dialecte propre (ABAP, juridique, biomédical) ET vous avez 10 G+ tokens ; sinon LoRA (C258) ou RAG (C203).
- Évaluation — conserver un benchmark domaine ET un benchmark général (MMLU, GSM8K) ; suivre les deux à chaque checkpoint pour détecter l'oubli en temps réel.
Termes employés sur cette page
- Catastrophic forgetting
- Le phénomène où un nouvel entraînement décale suffisamment les poids du modèle pour que des capacités générales apprises précédemment (mathématiques, multilinguisme, suivi d'instructions) se dégradent ; le mode de défaillance central du pré-entraînement continu.
- Replay buffer
- Un réservoir d'échantillons de la distribution de pré-entraînement d'origine mélangés à chaque nouveau batch d'entraînement (typiquement 5 à 15 %) pour ancrer la distribution générale et prévenir l'oubli.
- Perplexity filtering
- Retirer le texte de faible qualité d'un corpus d'entraînement en notant chaque document avec un modèle réputé fiable et en écartant les lignes du décile supérieur de perplexité (rebut traduit machine, bruit d'OCR, HTML corrompu).
- SemDeDup
- Déduplication sémantique par similarité cosinus des embeddings de phrases pour retirer les quasi-doublons que la déduplication simple par hachage laisse passer ; réduit la mémorisation et améliore la généralisation.
- Decision owner
- La personne responsable qui accepte l'arbitrage et finance l'action suivante.
- Semantic contract
- La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
- Control plane
- La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
- Evidence grade
- Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.
Sources
- arXiv: Continual Pre-Training of Large Language Models — How to (re)warm your model? (Ibrahim et al. 2024)
- arXiv: Simple and Scalable Strategies to Continually Pre-train Large Language Models (Gupta et al. 2024)
- Anthropic Responsible Scaling Policy — model training governance
- NIST AI Risk Management Framework 1.0
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- SAP Business AI — official product page
- SAP Joule (work companion) — official product page
- SAP Generative AI — official product page
- Stanford HAI — AI Index Report
- Meta AI — Llama model research
- arXiv — preprint archive (cs.CL/cs.AI)
- HuggingFace — model hub
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.