Analytics Legends Die Wissensplattform für SAP Analytics
Konzeptkarte

Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren

Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren — Abschnittsillustration von Analytics Legends für die SAP-Analytics-Wissensdatenbank (Konzepte, Studien, Academy)

Stand 2026-07-24T14:00:00Z

Was ist Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren?

Black-Box-Distillation — ein Lehrmodell mit geschlossener API auf den eigenen Domänen-Prompts laufen zu lassen und anschließend ein offenes Schülermodell mit den Ergebnissen fein abzustimmen — ist der einzige Modus, der bei Spitzenanbietern funktioniert, da er keinen Zugriff auf deren interne Struktur benötigt.

Was es ist

Modell-Distillation ist eine Trainingstechnik, die das erlernte Verhalten eines großen, teuren Lehrmodells auf ein kleineres, schnelleres Schülermodell überträgt. Das Ziel ist nicht, die Gewichte des Lehrmodells zu reproduzieren — das ist ohne Zugriff auf sie unmöglich —, sondern sein Ausgabeverhalten auf der Domäne der für Sie relevanten Aufgaben nachzubilden. Das Schülermodell trainiert auf Beispielen, die das Lehrmodell bereits verarbeitet hat, und lernt, dessen Antworten zu imitieren, während es zur Inferenzzeit weitaus günstiger im Betrieb bleibt.

Warum es zählt

  • Logit-Distillation liefert über KL-Divergenz auf der vollständigen Wahrscheinlichkeitsverteilung des Lehrmodells ein reichhaltigeres Trainingssignal, setzt aber voraus, dass das Lehrmodell seine Logits offenlegt — möglich bei Llama, nicht bei GPT-4 oder Claude.
  • Hidden-State-Distillation ist der dateneffizienteste Modus, benötigt aber architektonische Ähnlichkeit zwischen Lehr- und Schülermodell, was ihn unpraktikabel macht, wenn von einer proprietären Architektur in eine offene distilliert wird.
  • Der Enterprise-Fall für Distillation gegenüber reinem Prompting ist die Skalenökonomie: Jeder Frontier-API-Aufruf bezahlt weiterhin den Anbieter, während ein distilliertes Schülermodell bei der Inferenz weitaus günstiger läuft.

Kernpunkte

  • Ein kleines Schülermodell (7B-8B) wird trainiert, ein großes Lehrmodell (70B+) auf aufgabenspezifischen Prompts zu imitieren — 80-95 % der Qualität bei 5-10 % der Inferenzkosten.
  • Drei Modi — Black-Box (nur Textausgaben, funktioniert mit API-Lehrmodellen), Logit (vollständige Verteilung, offenes Lehrmodell), Hidden-State (tiefstes Signal, architektonische Ähnlichkeit).
  • Black-Box-Distillation gegen GPT-4/Claude ist das operative Enterprise-Muster — keine GPU-Trainingsinfrastruktur über ein Standard-Fine-Tuning hinaus nötig.
  • Funktioniert gut bei eng gefassten, klar definierten Aufgaben (Extraktion, Klassifizierung, strukturierte Generierung); versagt bei offenem Reasoning und Weltwissen-Aufgaben.
  • Synthetische Datengenerierung ist Distillation unter anderem Namen — DeepSeek-R1-distill (2025) und Phi-4 (Microsoft 2024) sind öffentliche Beispiele.
  • Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
  • Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
  • Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
  • Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
  • Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.

Begriffe auf dieser Seite

Distillation
Das Training eines kleinen Schülermodells, ein großes Lehrmodell auf einem aufgabenspezifischen Datensatz zu imitieren, wodurch dessen Verhalten zu einem Bruchteil der Inferenzkosten übertragen wird.
Lehrmodell
Das große, teure Modell, dessen Ausgaben (oder Ausgabeverteilungen) das Trainingssignal für das Schülermodell bilden; typischerweise 70B+ Parameter oder eine Frontier-API.
Schülermodell
Das kleine Modell, das trainiert wird; typischerweise 7B-8B Parameter; läuft nach der Distillation zu 10-100-fach geringeren Kosten als das Lehrmodell.
Synthetische Datengenerierung
Die Nutzung eines großen Modells zur Generierung von Trainingsbeispielen (Prompt-Antwort-Paaren), die anschließend zum Fine-Tuning eines kleineren Modells verwendet werden; das moderne Enterprise-Gesicht der Distillation.
Entscheidungsverantwortlicher
Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
Semantischer Kontrakt
Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
Kontrollebene
Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
Evidenzgrad
Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.

Quellen

  1. Hinton, Vinyals, Dean — Distilling the Knowledge in a Neural Network (the founding paper, 2015)
  2. DeepSeek-AI — DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (R1-distill family, 2025)
  3. Microsoft — Phi-4 Technical Report (2024)
  4. HuggingFace — TRL (Transformer Reinforcement Learning) distillation recipes
  5. SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
  6. SAP News Center — SAP Unveils the Autonomous Enterprise
  7. SAP News Center — The Future of the Enterprise Is Autonomous
  8. SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
  9. SAP Datasphere — Help Portal
  10. SAP Datasphere — official product page
  11. SAP Analytics Cloud — Help Portal
  12. SAP Analytics Cloud — official product page
  13. SAP BW/4HANA — Help Portal
  14. SAP S/4HANA — Help Portal
  15. SAP News Center
  16. SAP Community
  17. SAP — industries overview
  18. Gartner — research & analyst site
  19. BARC — BI & Analytics research
  20. TDWI — data & analytics research
  21. DSAG — German-speaking SAP user group
  22. ASUG — Americas' SAP User Group
  23. Databricks — official site
  24. SAP Community — Contextualize and reason post sap sapphire sap business data cloud briefing
  25. SAP Help Portal — SAP Autonomous Suite documentation

Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.

In der App öffnen →