Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Continual Pre-training — Domänenanpassung ohne Vergessen

Continual Pre-training — Domänenanpassung ohne Vergessen — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-23

Was ist Continual Pre-training — Domänenanpassung ohne Vergessen?

Continual Pre-training speist Milliarden von Domänen-Tokens in ein Foundation-Modell ein, um dessen Fachsprache vor dem aufgabenspezifischen Fine-Tuning zu verinnerlichen — riskiert dabei jedoch katastrophales Vergessen, sofern nicht Replay-Buffer, niedrige Lernraten und Loss-Masking dagegenwirken.

Worum es geht

Continual Pre-training (CPT) ist das Verfahren, ein vollständig vortrainiertes Foundation-Modell — Llama-3, Mistral, Qwen oder ein per Fine-Tuning-API zugängliches Frontier-Closed-Modell — zu nehmen und ihm Milliarden weiterer Tokens aus einer Zieldomäne zuzuführen, sodass das Modell Vokabular, Redewendungen und Denkmuster dieser Domäne verinnerlicht, bevor irgendein aufgabenspezifisches Fine-Tuning stattfindet. Für SAP-Analytics besteht der Zielkorpus aus einer kuratierten Mischung aus SAP-Help-Portal, OSS-Hinweisen, ABAP- und HANA-SQL-Code, SAP-Community-Threads und Kundenimplementierungsdokumentation.

Das zentrale Risiko ist katastrophales Vergessen — das Phänomen, bei dem neues Training die Gewichte so weit verschiebt, dass das Modell allgemeine Fähigkeiten verliert, die es zu Beginn hatte (Mathematik, mehrsprachiges Schlussfolgern, Befolgen von Anweisungen). Drei Leitplanken dominieren die Literatur. Replay-Buffer mischen 5-15 % der ursprünglichen Pretraining-Verteilung in jeden CPT-Batch zurück, damit die allgemeine Verteilung verankert bleibt. Niedrige Lernraten (1e-5 bis 5e-5 gegenüber 1e-4 beim Pretraining von Grund auf) halten Gewichtsaktualisierungen klein. Loss-Masking auf System-Tokens und reservierten Instruktions-Markern verhindert, dass sich das Modell auf Formatierungsartefakte überanpasst.

Warum es zählt

  • Drei konkrete Leitplanken verhindern Vergessen: 5-15 % Replay der ursprünglichen Pretraining-Daten pro Batch, Lernraten von 1e-5 bis 5e-5 (gegenüber 1e-4 bei Pretraining von Grund auf) und Loss-Masking auf System-/Instruktions-Tokens.
  • Die meisten CPT-Projekte scheitern an der Daten-Pipeline, nicht an der Trainingsschleife — Deduplizierung (MinHash/SemDeDup) und perplexity-basierte Qualitätsfilterung sind nicht verhandelbar.
  • Die Entscheidungsregel ist explizit: greifen Sie zu CPT bei 10 Mrd.+ Tokens domänenspezifischen Dialekts (SAP ABAP, Recht, Biomedizin); greifen Sie zu LoRA (C258), wenn nur 10.000 bis 10 Millionen Aufgabenbeispiele vorliegen.

Kernpunkte

  • Verfahren — 10 Mrd.-100 Mrd. Tokens Domänentext in ein vortrainiertes Modell bei niedriger Lernrate (1e-5 bis 5e-5) einspeisen, bevor überhaupt aufgabenspezifisches Fine-Tuning beginnt.
  • Katastrophales Vergessen — das Hauptrisiko; abgemildert durch Replay-Buffer (5-15 % der ursprünglichen Verteilung), niedrige Lernrate und Loss-Masking auf System-Tokens.
  • Daten-Pipeline — MinHash-/SemDeDup-Deduplizierung, perplexity-basierte Qualitätsfilterung, PII-Bereinigung, Herkunftsprotokollierung gemäß Art. 10 EU-AI-Act sind verpflichtend.
  • Wann einsetzen — die Domäne hat ihren eigenen Dialekt (ABAP, Recht, Biomedizin) UND Sie haben 10 Mrd.+ Tokens; andernfalls LoRA-Fine-Tuning (C258) oder RAG (C203) verwenden.
  • Evaluation — sowohl einen Domänen-Benchmark ALS AUCH einen allgemeinen Benchmark (MMLU, GSM8K) zurückhalten; beide bei jedem Checkpoint verfolgen, um Vergessen in Echtzeit zu erkennen.
  • Continual Pre-training — Domain Adaptation Without Forgetting ist erst dann beherrscht, wenn es eine benannte Käuferentscheidung verändert.
  • Beginnen Sie mit dem semantischen Vertrag und dem Kontrollmodell, bevor Sie das Tool vorführen.
  • Nutzen Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Metrik, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Katastrophales Vergessen
Das Phänomen, bei dem neues Training die Modellgewichte so weit verschiebt, dass zuvor gelernte allgemeine Fähigkeiten (Mathematik, Mehrsprachigkeit, Befolgen von Anweisungen) sich verschlechtern; der zentrale Fehlermodus von Continual Pre-training.
Replay buffer
Ein Pool von Stichproben aus der ursprünglichen Pretraining-Verteilung, die in jeden neuen Trainings-Batch gemischt werden (typischerweise 5-15 %), um die allgemeine Verteilung zu verankern und Vergessen zu verhindern.
Perplexity filtering
Entfernen minderwertigen Texts aus einem Trainingskorpus, indem jedes Dokument mit einem bekannt guten Modell bewertet und die Zeilen mit der höchsten Perplexity (maschinell übersetzter Ausschuss, OCR-Rauschen, defektes HTML) verworfen werden.
SemDeDup
Semantische Deduplizierung mittels Cosinus-Ähnlichkeit von Satz-Embeddings, um Beinahe-Duplikate zu entfernen, die eine einfache hashbasierte Deduplizierung übersieht; reduziert Auswendiglernen und verbessert Generalisierung.
Decision owner
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantic contract
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Control plane
Die Schicht, die Richtlinien, Zugriff, Herkunftsnachweis, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidence grade
Eine Kennzeichnung, die verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. arXiv: Continual Pre-Training of Large Language Models — How to (re)warm your model? (Ibrahim et al. 2024)
  2. arXiv: Simple and Scalable Strategies to Continually Pre-train Large Language Models (Gupta et al. 2024)
  3. Anthropic Responsible Scaling Policy — model training governance
  4. NIST AI Risk Management Framework 1.0
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. SAP Business AI — official product page
  19. SAP Joule (work companion) — official product page
  20. SAP Generative AI — official product page
  21. Stanford HAI — AI Index Report
  22. Meta AI — Llama model research
  23. arXiv — preprint archive (cs.CL/cs.AI)
  24. HuggingFace — model hub
  25. Gartner — research & analyst site
  26. BARC — BI & Analytics research
  27. TDWI — data & analytics research
  28. DSAG — German-speaking SAP user group
  29. ASUG — Americas' SAP User Group
  30. Databricks — official site

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke.

In der App öffnen →