Analytics Legends La plateforme de connaissance SAP Analytics
Fiche concept

Pré-entraînement continu — Adaptation au domaine sans oubli

Pré-entraînement continu — Adaptation au domaine sans oubli — illustration de section Analytics Legends pour la base de connaissances SAP Analytics (concepts, études, Academy)

À jour au 2026-07-23

Qu'est-ce que Pré-entraînement continu — Adaptation au domaine sans oubli ?

Le pré-entraînement continu injecte des milliards de tokens de domaine dans un modèle de fondation pour en intérioriser le dialecte avant tout fine-tuning de tâche — mais risque l'oubli catastrophique sans tampons de relecture, taux d'apprentissage faibles et masquage de perte.

De quoi il s'agit

Le pré-entraînement continu (CPT) consiste à prendre un modèle de fondation déjà pré-entraîné — Llama-3, Mistral, Qwen ou un modèle frontière fermé exposé via API de fine-tuning — et à lui injecter plusieurs milliards de tokens supplémentaires issus d'un domaine cible, afin que le modèle intériorise le vocabulaire, les idiomes et les schémas de raisonnement de ce domaine avant tout fine-tuning spécifique à une tâche. Pour l'analytique SAP, le corpus cible est un mélange curé de SAP Help Portal, de notes OSS, de code ABAP et SQL HANA, de fils SAP Community et de documentation d'implémentation client.

Le risque central est l'oubli catastrophique — le phénomène où le nouvel entraînement déplace les poids au point que le modèle perd les capacités générales qu'il avait initialement (mathématiques, raisonnement multilingue, suivi d'instructions). Trois garde-fous dominent la littérature. Les tampons de relecture (replay buffers) réinjectent 5-15 % de la distribution de pré-entraînement initiale à chaque batch CPT pour ancrer la distribution générale. Les taux d'apprentissage faibles (1e-5 à 5e-5 contre 1e-4 pour un pré-entraînement from-scratch) maintiennent les mises à jour de poids petites. Le masquage de perte sur les tokens système et les marqueurs d'instruction réservés évite le sur-apprentissage des artefacts de formatage.

Pourquoi c'est important

  • Trois garde-fous concrets préviennent l'oubli : relecture de 5-15 % des données de pré-entraînement d'origine par batch, taux d'apprentissage 1e-5 à 5e-5 (contre 1e-4 from-scratch), et masquage de perte sur les tokens système/instruction.
  • La plupart des projets CPT échouent sur le pipeline de données, pas la boucle d'entraînement — déduplication (MinHash/SemDeDup) et filtrage qualité par perplexité sont non négociables.
  • La règle de décision est explicite : recourir au CPT avec 10 Md+ tokens de dialecte de domaine (ABAP SAP, juridique, biomédical) ; recourir au LoRA (C258) avec seulement 10 K-10 M exemples de tâche.

Points clés

  • Procédure — injecter 10 à 100 milliards de tokens de texte du domaine dans un modèle pré-entraîné avec un taux d'apprentissage faible (1e-5 à 5e-5) avant tout fine-tuning de tâche.
  • Oubli catastrophique — le risque principal ; mitigé par les replay buffers (5-15 % de distribution initiale), un LR bas et le masquage de perte sur tokens système.
  • Pipeline de données — déduplication MinHash/SemDeDup, filtrage qualité par perplexité, nettoyage PII, traçabilité Art. 10 du règlement IA obligatoires.
  • Quand l'utiliser — le domaine a un dialecte propre (ABAP, juridique, biomédical) ET vous avez 10 G+ tokens ; sinon LoRA (C258) ou RAG (C203).
  • Évaluation — conserver un benchmark domaine ET un benchmark général (MMLU, GSM8K) ; suivre les deux à chaque checkpoint pour détecter l'oubli en temps réel.

Termes employés sur cette page

Catastrophic forgetting
Le phénomène où un nouvel entraînement décale suffisamment les poids du modèle pour que des capacités générales apprises précédemment (mathématiques, multilinguisme, suivi d'instructions) se dégradent ; le mode de défaillance central du pré-entraînement continu.
Replay buffer
Un réservoir d'échantillons de la distribution de pré-entraînement d'origine mélangés à chaque nouveau batch d'entraînement (typiquement 5 à 15 %) pour ancrer la distribution générale et prévenir l'oubli.
Perplexity filtering
Retirer le texte de faible qualité d'un corpus d'entraînement en notant chaque document avec un modèle réputé fiable et en écartant les lignes du décile supérieur de perplexité (rebut traduit machine, bruit d'OCR, HTML corrompu).
SemDeDup
Déduplication sémantique par similarité cosinus des embeddings de phrases pour retirer les quasi-doublons que la déduplication simple par hachage laisse passer ; réduit la mémorisation et améliore la généralisation.
Decision owner
La personne responsable qui accepte l'arbitrage et finance l'action suivante.
Semantic contract
La définition partagée des termes métier, indicateurs, entités et règles d'accès utilisée par les outils et les équipes.
Control plane
La couche qui applique politique, accès, traçabilité (lineage), supervision et escalade à travers le modèle opérationnel.
Evidence grade
Une étiquette qui distingue le fait vérifié, le signal directionnel, l'hypothèse modélisée et l'observation de terrain.

Sources

  1. arXiv: Continual Pre-Training of Large Language Models — How to (re)warm your model? (Ibrahim et al. 2024)
  2. arXiv: Simple and Scalable Strategies to Continually Pre-train Large Language Models (Gupta et al. 2024)
  3. Anthropic Responsible Scaling Policy — model training governance
  4. NIST AI Risk Management Framework 1.0
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code.

Ouvrir dans l'application →