Pré-entraînement continu — Adaptation au domaine sans oubli
À jour au 2026-10-09
Qu'est-ce que Pré-entraînement continu ?
Le pré-entraînement continu injecte des milliards de tokens de domaine dans un modèle de fondation pour en intérioriser le dialecte avant tout fine-tuning de tâche — mais risque l'oubli catastrophique sans tampons de relecture, taux d'apprentissage faibles et masquage de perte.
De quoi il s'agit
Le pré-entraînement continu (CPT) consiste à prendre un modèle de fondation déjà pré-entraîné — Llama-3, Mistral, Qwen ou un modèle frontière fermé exposé via API de fine-tuning — et à lui injecter plusieurs milliards de tokens supplémentaires issus d'un domaine cible, afin que le modèle intériorise le vocabulaire, les idiomes et les schémas de raisonnement de ce domaine avant tout fine-tuning spécifique à une tâche. Pour l'analytique SAP, le corpus cible est un mélange curé de SAP Help Portal, de notes OSS, de code ABAP et SQL HANA, de fils SAP Community et de documentation d'implémentation client.
Le risque central est l'oubli catastrophique — le phénomène où le nouvel entraînement déplace les poids au point que le modèle perd les capacités générales qu'il avait initialement (mathématiques, raisonnement multilingue, suivi d'instructions). Trois garde-fous dominent la littérature. Les tampons de relecture (replay buffers) réinjectent 5-15 % de la distribution de pré-entraînement initiale à chaque batch CPT pour ancrer la distribution générale. Les taux d'apprentissage faibles (1e-5 à 5e-5 contre 1e-4 pour un pré-entraînement from-scratch) maintiennent les mises à jour de poids petites. Le masquage de perte sur les tokens système et les marqueurs d'instruction réservés évite le sur-apprentissage des artefacts de formatage.
Pourquoi c'est important
- Trois garde-fous concrets préviennent l'oubli : relecture de 5-15 % des données de pré-entraînement d'origine par batch, taux d'apprentissage 1e-5 à 5e-5 (contre 1e-4 from-scratch), et masquage de perte sur les tokens système/instruction.
- La plupart des projets CPT échouent sur le pipeline de données, pas la boucle d'entraînement — déduplication (MinHash/SemDeDup) et filtrage qualité par perplexité sont non négociables.
- La règle de décision est explicite : recourir au CPT avec 10 Md+ tokens de dialecte de domaine (ABAP SAP, juridique, biomédical) ; recourir au LoRA (C258) avec seulement 10 K-10 M exemples de tâche.
Points clés
- Procédure — injecter 10 à 100 milliards de tokens de texte du domaine dans un modèle pré-entraîné avec un taux d'apprentissage faible (1e-5 à 5e-5) avant tout fine-tuning de tâche.
- Oubli catastrophique — le risque principal ; mitigé par les replay buffers (5-15 % de distribution initiale), un LR bas et le masquage de perte sur tokens système.
- Pipeline de données — déduplication MinHash/SemDeDup, filtrage qualité par perplexité, nettoyage PII, traçabilité Art. 10 du règlement IA obligatoires.
- Quand l'utiliser — le domaine a un dialecte propre (ABAP, juridique, biomédical) ET vous avez 10 G+ tokens ; sinon LoRA (C258) ou RAG (C203).
- Évaluation — conserver un benchmark domaine ET un benchmark général (MMLU, GSM8K) ; suivre les deux à chaque checkpoint pour détecter l'oubli en temps réel.
- Prudence spécifique SAP — les SAP Domain Models (SAP-ABAP-2 et successeurs) existent et tournent sous Joule/Joule Studio, mais SAP n'a pas publié qu'ils soient construits spécifiquement via le pré-entraînement continu ; considérer la méthode d'entraînement comme non documentée, pas comme du CPT par défaut.
- Le generative AI hub de SAP privilégie par défaut l'orchestration (ancrage) et le fine-tuning façon LoRA avant tout ce qui ressemble à du CPT — n'y recourir qu'une fois que le nombre de tokens et l'ampleur du dialecte franchissent les seuils du tableau de décision.
- Mesurer le nombre de tokens post-déduplication avant de cadrer la technique — un corpus qui paraît volumineux en octets bruts peut rester bien en-dessous du seuil de 10 G tokens une fois le boilerplate et les quasi-doublons retirés.
Termes employés sur cette page
- Catastrophic forgetting
- Le phénomène où un nouvel entraînement décale suffisamment les poids du modèle pour que des capacités générales apprises précédemment (mathématiques, multilinguisme, suivi d'instructions) se dégradent ; le mode de défaillance central du pré-entraînement continu.
- Replay buffer
- Un réservoir d'échantillons de la distribution de pré-entraînement d'origine mélangés à chaque nouveau batch d'entraînement (typiquement 5 à 15 %) pour ancrer la distribution générale et prévenir l'oubli.
- Perplexity filtering
- Retirer le texte de faible qualité d'un corpus d'entraînement en notant chaque document avec un modèle réputé fiable et en écartant les lignes du décile supérieur de perplexité (rebut traduit machine, bruit d'OCR, HTML corrompu).
- SemDeDup
- Déduplication sémantique (Abbas et al., 2023) par similarité cosinus des embeddings de phrases pour retirer les quasi-doublons que la déduplication simple par hachage laisse passer ; réduit la mémorisation et améliore la généralisation.
- Elastic Weight Consolidation (EWC)
- Technique de Kirkpatrick et al. (2017) qui ralentit l'apprentissage sur les poids identifiés comme importants pour des tâches apprises précédemment, une approche précoce et influente pour limiter l'oubli catastrophique, antérieure à l'approche par replay buffer dominante dans la pratique LLM de 2026.
- Domain-adaptive pretraining (DAPT)
- Le terme de Gururangan et al. pour une alternative plus légère au CPT complet : une seule phase additionnelle de pré-entraînement in-domain, dont il est démontré qu'elle produit des gains mesurables même sur des corpus de domaine modestes, souvent le bon choix quand le corpus cible reste en-deçà du seuil de plusieurs milliards de tokens du CPT.
- Learning-rate re-warming / re-decaying
- La pratique consistant à relever temporairement le taux d'apprentissage vers son échelonnement d'origine au démarrage d'un run de pré-entraînement continu sur de nouvelles données, puis à le redécroître — démontré comme permettant à un modèle pré-entraîné en continu d'égaler la qualité d'un ré-entraînement from-scratch pour une fraction du calcul.
Sources
- arXiv: Continual Pre-Training of Large Language Models — How to (re)warm your model? (Ibrahim et al. 2024)
- arXiv: Simple and Scalable Strategies to Continually Pre-train Large Language Models (Gupta et al. 2024)
- Anthropic Responsible Scaling Policy — model training governance
- NIST AI Risk Management Framework 1.0
- SAP Generative AI — official product page
- arXiv — Abbas et al., "SemDeDup: Data-efficient learning at web-scale through semantic deduplication" (2023, fetched 2026-09-27)
- arXiv — Lee et al., "Deduplicating Training Data Makes Language Models Better" (2021, fetched 2026-09-27)
- arXiv — Gururangan et al., "Don't Stop Pretraining: Adapt Language Models to Domains and Tasks" (ACL 2020, fetched 2026-09-27)
- arXiv — Kirkpatrick et al., "Overcoming catastrophic forgetting in neural networks" — the Elastic Weight Consolidation paper (2017, fetched 2026-09-27)
- SAP Help Portal — Orchestration service in the generative AI hub, SAP AI Core (fetched 2026-09-27)
- SAP Help Portal — Metering and pricing for generative AI, SAP AI Core service guide (fetched 2026-09-27)
- EUR-Lex — Regulation (EU) 2024/1689 (EU AI Act), consolidated text incl. Art. 10 data governance (fetched 2026-09-27)
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.