Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren
Stand 2026-07-24T14:00:00Z
Was ist Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren?
Black-Box-Distillation — ein Lehrmodell mit geschlossener API auf den eigenen Domänen-Prompts laufen zu lassen und anschließend ein offenes Schülermodell mit den Ergebnissen fein abzustimmen — ist der einzige Modus, der bei Spitzenanbietern funktioniert, da er keinen Zugriff auf deren interne Struktur benötigt.
Was es ist
Modell-Distillation ist eine Trainingstechnik, die das erlernte Verhalten eines großen, teuren Lehrmodells auf ein kleineres, schnelleres Schülermodell überträgt. Das Ziel ist nicht, die Gewichte des Lehrmodells zu reproduzieren — das ist ohne Zugriff auf sie unmöglich —, sondern sein Ausgabeverhalten auf der Domäne der für Sie relevanten Aufgaben nachzubilden. Das Schülermodell trainiert auf Beispielen, die das Lehrmodell bereits verarbeitet hat, und lernt, dessen Antworten zu imitieren, während es zur Inferenzzeit weitaus günstiger im Betrieb bleibt.
Warum es zählt
- Logit-Distillation liefert über KL-Divergenz auf der vollständigen Wahrscheinlichkeitsverteilung des Lehrmodells ein reichhaltigeres Trainingssignal, setzt aber voraus, dass das Lehrmodell seine Logits offenlegt — möglich bei Llama, nicht bei GPT-4 oder Claude.
- Hidden-State-Distillation ist der dateneffizienteste Modus, benötigt aber architektonische Ähnlichkeit zwischen Lehr- und Schülermodell, was ihn unpraktikabel macht, wenn von einer proprietären Architektur in eine offene distilliert wird.
- Der Enterprise-Fall für Distillation gegenüber reinem Prompting ist die Skalenökonomie: Jeder Frontier-API-Aufruf bezahlt weiterhin den Anbieter, während ein distilliertes Schülermodell bei der Inferenz weitaus günstiger läuft.
Kernpunkte
- Ein kleines Schülermodell (7B-8B) wird trainiert, ein großes Lehrmodell (70B+) auf aufgabenspezifischen Prompts zu imitieren — 80-95 % der Qualität bei 5-10 % der Inferenzkosten.
- Drei Modi — Black-Box (nur Textausgaben, funktioniert mit API-Lehrmodellen), Logit (vollständige Verteilung, offenes Lehrmodell), Hidden-State (tiefstes Signal, architektonische Ähnlichkeit).
- Black-Box-Distillation gegen GPT-4/Claude ist das operative Enterprise-Muster — keine GPU-Trainingsinfrastruktur über ein Standard-Fine-Tuning hinaus nötig.
- Funktioniert gut bei eng gefassten, klar definierten Aufgaben (Extraktion, Klassifizierung, strukturierte Generierung); versagt bei offenem Reasoning und Weltwissen-Aufgaben.
- Synthetische Datengenerierung ist Distillation unter anderem Namen — DeepSeek-R1-distill (2025) und Phi-4 (Microsoft 2024) sind öffentliche Beispiele.
- Modell-Distillation — kleine Modelle von großen Lehrmodellen trainieren ist erst dann beherrscht, wenn es eine benannte Kaufentscheidung verändert.
- Beginnen Sie mit dem semantischen Kontrakt und dem Kontrollmodell, bevor Sie das Tool demonstrieren.
- Verwenden Sie aktuelle SAP-, Analysten-, Studien-, Knowledge-Graph- und News-Signale als Belege, nicht als Dekoration.
- Trennen Sie verifizierte Fakten von richtungsweisenden Trends und modellierten Annahmen.
- Definieren Sie Owner, Kennzahl, Schwellenwert, Support-Pfad und Rollback, bevor Sie skalieren.
Begriffe auf dieser Seite
- Distillation
- Das Training eines kleinen Schülermodells, ein großes Lehrmodell auf einem aufgabenspezifischen Datensatz zu imitieren, wodurch dessen Verhalten zu einem Bruchteil der Inferenzkosten übertragen wird.
- Lehrmodell
- Das große, teure Modell, dessen Ausgaben (oder Ausgabeverteilungen) das Trainingssignal für das Schülermodell bilden; typischerweise 70B+ Parameter oder eine Frontier-API.
- Schülermodell
- Das kleine Modell, das trainiert wird; typischerweise 7B-8B Parameter; läuft nach der Distillation zu 10-100-fach geringeren Kosten als das Lehrmodell.
- Synthetische Datengenerierung
- Die Nutzung eines großen Modells zur Generierung von Trainingsbeispielen (Prompt-Antwort-Paaren), die anschließend zum Fine-Tuning eines kleineren Modells verwendet werden; das moderne Enterprise-Gesicht der Distillation.
- Entscheidungsverantwortlicher
- Die verantwortliche Person, die den Trade-off akzeptiert und die nächste Maßnahme finanziert.
- Semantischer Kontrakt
- Die gemeinsame Definition von Geschäftsbegriffen, Kennzahlen, Entitäten und Zugriffsregeln, die von Tools und Teams verwendet wird.
- Kontrollebene
- Die Schicht, die Richtlinien, Zugriff, Lineage, Monitoring und Eskalation über das Betriebsmodell hinweg durchsetzt.
- Evidenzgrad
- Ein Label, das verifizierte Fakten, richtungsweisende Signale, modellierte Annahmen und Feldbeobachtungen unterscheidet.
Quellen
- Hinton, Vinyals, Dean — Distilling the Knowledge in a Neural Network (the founding paper, 2015)
- DeepSeek-AI — DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (R1-distill family, 2025)
- Microsoft — Phi-4 Technical Report (2024)
- HuggingFace — TRL (Transformer Reinforcement Learning) distillation recipes
- SAP News Center — Accelerate the Autonomous Enterprise with SAP Business Data Cloud
- SAP News Center — SAP Unveils the Autonomous Enterprise
- SAP News Center — The Future of the Enterprise Is Autonomous
- SAP News Center — 2026 SAP Sapphire Keynote: Powering the Autonomous Enterprise
- SAP Datasphere — Help Portal
- SAP Datasphere — official product page
- SAP Analytics Cloud — Help Portal
- SAP Analytics Cloud — official product page
- SAP BW/4HANA — Help Portal
- SAP S/4HANA — Help Portal
- SAP News Center
- SAP Community
- SAP — industries overview
- Gartner — research & analyst site
- BARC — BI & Analytics research
- TDWI — data & analytics research
- DSAG — German-speaking SAP user group
- ASUG — Americas' SAP User Group
- Databricks — official site
- SAP Community — Contextualize and reason post sap sapphire sap business data cloud briefing
- SAP Help Portal — SAP Autonomous Suite documentation
Vollständige Karte für Mitglieder. Was die vollständige Karte ergänzt: den vollständigen Entscheidungsrahmen · den Vergleich SAP · Snowflake · Databricks · Fabric · die häufigen Fallstricke und ihre Behebung · die Kurzreferenz · die Architekturschemata · die Codeblöcke · die zitierfähigen Kennzahlen.