Distillation de modèles — Entraîner des petits modèles à partir de grands enseignants
À jour au 2026-09-27
Qu'est-ce que Distillation de modèles ?
La distillation boîte noire — faire tourner un enseignant API fermée comme GPT-4o ou Claude Opus sur vos prompts du domaine, puis fine-tuner un étudiant open-weight sur les résultats — est le seul mode de distillation qui fonctionne avec les éditeurs fermés, car il ne nécessite aucun accès à leurs internes.
Ce que c'est
La distillation de modèle est une technique d'entraînement qui transfère le comportement appris d'un grand modèle enseignant coûteux vers un modèle élève plus petit et plus rapide. L'objectif n'est pas de reproduire les poids de l'enseignant — c'est impossible sans y avoir accès — mais de reproduire son comportement de sortie sur le domaine de tâches qui vous importe. L'élève s'entraîne sur des exemples déjà traités par l'enseignant, apprenant à imiter ses réponses tout en restant bien moins coûteux à exécuter au moment de l'inférence.
Pourquoi c'est important
- La distillation par logits donne un signal d'entraînement plus riche via la divergence KL sur toute la distribution de probabilité de l'enseignant, mais exige que l'enseignant expose ses logits — possible avec Llama, pas avec GPT-4 ou Claude.
- La distillation par états cachés est la plus efficace en données mais exige une similarité architecturale entre enseignant et étudiant, ce qui la rend impraticable pour distiller d'une architecture propriétaire vers un modèle open-weight.
- L'argument entreprise pour distiller plutôt que prompter est l'économie d'échelle : chaque appel à l'API frontière continue de payer le fournisseur, tandis qu'un étudiant distillé tourne bien moins cher à l'inférence.
Points clés
- Entraîner un petit étudiant (7B-8B) à imiter un grand enseignant (70B+) sur prompts spécifiques — 80-95 % de qualité à 5-10 % du coût.
- Trois modes — boîte noire (sorties texte, marche avec API), logits (distribution complète, enseignant à poids ouverts), états cachés (signal le plus profond, similarité architecturale).
- La distillation boîte noire contre GPT-4/Claude est le pattern opérant en entreprise — pas d'infra GPU au-delà d'un fine-tune standard.
- Gagne sur tâches étroites bien définies (extraction, classification, génération structurée) ; échoue sur raisonnement ouvert + connaissances du monde.
- La génération de données synthétiques est de la distillation sous un autre nom — DeepSeek-R1-distill (2025), Phi-4 (Microsoft 2024) sont des exemples publics.
- La fonctionnalité Model Distillation d'OpenAI opérationnalise ce flux de bout en bout dans une seule API : `store: true` sur Chat Completions capture les paires entrée-sortie de l'enseignant sous forme de stored completions, utilisées ensuite directement comme jeu de données de fine-tuning pour un modèle plus petit.
- Vérifier la licence de l'enseignant avant de construire le pipeline : la Llama Community License de Meta et la plupart des conditions d'utilisation des API fermées interdisent d'utiliser les sorties d'un modèle pour entraîner un modèle directement concurrent — une revue juridique doit intervenir avant le premier run de distillation, pas après le déploiement.
- Databricks Mosaic AI Training et Snowflake Cortex Fine-tuning exposent tous deux des jobs de fine-tuning managés capables de consommer directement un jeu de données généré par un enseignant, si bien qu'une entreprise déjà sur l'une ou l'autre plateforme n'a pas besoin d'une infrastructure de distillation séparée.
Termes employés sur cette page
- Distillation
- Entraînement d'un petit modèle élève à imiter un grand modèle enseignant sur un jeu de données spécifique à une tâche, transférant le comportement de l'enseignant à une fraction du coût d'inférence.
- Teacher
- Le grand modèle coûteux dont les sorties (ou distributions de sortie) forment le signal d'entraînement de l'élève ; typiquement 70B+ paramètres ou une API frontière.
- Student
- Le petit modèle en cours d'entraînement ; typiquement 7B-8B paramètres ; s'exécute à un coût 10-100x inférieur à l'enseignant après distillation.
- Synthetic data generation
- Utilisation d'un grand modèle pour générer des exemples d'entraînement (paires prompt-réponse) ensuite utilisés pour affiner un modèle plus petit ; le visage moderne de la distillation en entreprise.
- Chain-of-thought distillation
- Entraîner un élève sur la trace de raisonnement complète de l'enseignant plutôt que sur sa seule réponse finale — la technique derrière DeepSeek-R1-distill et des élèves similaires de modèles de raisonnement ; préserve davantage du comportement de résolution de problème étape par étape de l'enseignant qu'une distillation limitée à la sortie.
- Stored completions
- Le mécanisme d'OpenAI pour capturer les paires entrée-sortie du trafic API en direct (via un flag `store: true` sur Chat Completions) afin de constituer un jeu de données de distillation ou d'évaluation sans pipeline de journalisation séparé.
Sources
- Hinton, Vinyals, Dean — Distilling the Knowledge in a Neural Network (the founding paper, 2015)
- DeepSeek-AI — DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (R1-distill family, 2025)
- Microsoft — Phi-4 Technical Report (2024)
- HuggingFace — TRL (Transformer Reinforcement Learning) distillation recipes
- SAP Help Portal — SAP Autonomous Suite documentation
- OpenAI — Model Distillation in the API (product announcement)
- OpenAI Cookbook — Leveraging model distillation to fine-tune a model
- Microsoft Learn — Stored completions and distillation in Azure OpenAI / Foundry
- Meta — Llama 4 Community License Agreement
- Databricks — Introducing Mosaic AI Model Training for fine-tuning GenAI models
- Snowflake Docs — Fine-tuning (Snowflake Cortex)
- Snowflake — Cortex Fine-tuning general availability release note (2025-02-07)
- Databricks Docs — Mosaic AI Training finetuning reference
Fiche complète réservée aux abonnés. Ce que la fiche complète ajoute : le cadre de décision complet · la comparaison SAP · Snowflake · Databricks · Fabric · les pièges courants et leur correctif · l'aide-mémoire · les schémas d'architecture · les blocs de code · les chiffres à citer.