Aller au contenu
Notitia

Distillation de modèleKnowledge distillation

Réponse directe

Une technique qui entraîne un modèle plus petit à reproduire une partie du comportement d’un modèle plus grand.

Explication détaillée

Le grand modèle, appelé professeur, produit des réponses ou des probabilités qui servent de signal d’apprentissage à un modèle élève. L’objectif est de conserver une partie des capacités utiles tout en réduisant la mémoire, le coût ou le temps de calcul. L’élève ne devient pas une copie parfaite : il peut perdre certaines capacités et hériter de défauts du professeur.

Exemple

Un laboratoire peut utiliser un grand modèle pour produire des exemples détaillés, puis entraîner un modèle plus compact à effectuer une tâche de classification similaire sur un appareil moins puissant.

Analogie

C’est comme demander à un expert de préparer des exercices corrigés afin de transmettre l’essentiel de sa méthode à un élève plus rapide et moins coûteux à mobiliser.

Erreurs fréquentes

« La distillation consiste à supprimer des fichiers du modèle. » Elle implique l’entraînement d’un modèle élève à partir du signal d’un professeur. « L’élève devient identique au professeur. » Il cherche à reproduire certains comportements, avec des compromis. « Un modèle distillé est forcément sûr ou exact. » Il peut conserver des erreurs, des biais ou des limites du modèle source.

Termes liés

Sources

Dernière mise à jour : 24/07/2026 · Rédaction : Alban Speckaert