Distillation de modèleKnowledge distillation
Réponse directe
Une technique qui entraîne un modèle plus petit à reproduire une partie du comportement d’un modèle plus grand.
Explication détaillée
Le grand modèle, appelé professeur, produit des réponses ou des probabilités qui servent de signal d’apprentissage à un modèle élève. L’objectif est de conserver une partie des capacités utiles tout en réduisant la mémoire, le coût ou le temps de calcul. L’élève ne devient pas une copie parfaite : il peut perdre certaines capacités et hériter de défauts du professeur.
Exemple
Un laboratoire peut utiliser un grand modèle pour produire des exemples détaillés, puis entraîner un modèle plus compact à effectuer une tâche de classification similaire sur un appareil moins puissant.
Analogie
C’est comme demander à un expert de préparer des exercices corrigés afin de transmettre l’essentiel de sa méthode à un élève plus rapide et moins coûteux à mobiliser.
Erreurs fréquentes
« La distillation consiste à supprimer des fichiers du modèle. » Elle implique l’entraînement d’un modèle élève à partir du signal d’un professeur.
« L’élève devient identique au professeur. » Il cherche à reproduire certains comportements, avec des compromis.
« Un modèle distillé est forcément sûr ou exact. » Il peut conserver des erreurs, des biais ou des limites du modèle source.
Termes liés
Sources
- Distilling the Knowledge in a Neural Network — Hinton, Vinyals et Dean — arXiv · consulté le 2026-07-24
- Small Language Models: Survey, Measurements, and Insights — arXiv · consulté le 2026-07-24
Dernière mise à jour : 24/07/2026 · Rédaction : Alban Speckaert
