Transmettre à un modèle plus léger
Qu’est-ce que la distillation d’un modèle d’IA ?
La distillation entraîne un modèle « élève » à reproduire une partie du comportement d’un modèle « professeur », généralement plus grand. L’objectif est souvent d’obtenir un modèle plus petit, plus rapide ou moins coûteux à utiliser.
Regardez ce qui est transmis
Une étiquette dit moins qu’une distribution
Les probabilités sont fictives. Elles montrent pourquoi les sorties du professeur peuvent apprendre davantage à l’élève qu’une seule bonne réponse.
Le mécanisme
Le professeur est fixé, l’élève s’ajuste
Les mêmes exemples sont présentés aux deux modèles. Une fonction de perte mesure l’écart entre leurs sorties, parfois combiné avec les véritables étiquettes. Seuls les paramètres de l’élève sont mis à jour.
- 1
Le professeur répond
Il produit des scores ou une génération. - 2
L’élève répond
Avec sa capacité plus limitée. - 3
On compare
L’écart devient un signal d’apprentissage. - 4
L’élève s’ajuste
Le professeur reste inchangé.
Pourquoi « adoucir » les scores ?
Les petites probabilités contiennent aussi de l’information
Une température appliquée pendant l’entraînement peut rendre la distribution moins tranchée. Les rapports entre classes secondaires deviennent plus visibles et donnent un signal plus riche à l’élève.
Ce n’est pas la température de génération. Le mot est similaire, mais il sert ici à préparer les sorties utilisées pour entraîner l’élève.
chat 96 %renard 3 %chien 1 %
chat 62 %renard 24 %chien 14 %
Pourquoi le faire ?
Rendre l’inférence plus légère
Un élève plus petit peut être plus facile à charger sur un appareil.
Moins de calcul peut réduire la latence.
Servir de nombreuses demandes peut demander moins de ressources.
Certains élèves peuvent fonctionner sur mobile ou matériel limité.
Ne pas tout mélanger
Quatre techniques, quatre objectifs
Imiter un professeur
Entraîne un autre modèle à rapprocher ses sorties.
Réduire la précision des nombres
Allège souvent un modèle existant sans professeur.
Retirer des éléments
Supprime certains poids ou structures jugés moins utiles.
Spécialiser un modèle
Ajuste son comportement à une tâche ou à des exemples ciblés.
Les compromis
Plus petit ne veut pas dire équivalent
L’élève peut perdre en précision, en nuance ou en polyvalence.
Il peut reproduire les erreurs et préférences du professeur.
Il n’imite correctement que les situations montrées pendant la distillation.
Le gain de vitesse doit être comparé aux pertes sur les cas réels et sensibles.
Évaluer un modèle distillé
Six questions avant de le déployer
- 01
Quel professeur ?
Qualité, limites et droits d’usage. - 02
Quelles données ?
Représentent-elles les situations réelles ? - 03
Que doit conserver l’élève ?
Une tâche précise ou plusieurs capacités ? - 04
Quel gain mesuré ?
Taille, latence, débit, énergie et coût. - 05
Quelle perte de qualité ?
Comparer sur un jeu de test séparé. - 06
Quels cas sensibles ?
Tester erreurs rares, biais et sécurité.
Sources de référence
Pour approfondir
Ces ressources présentent la méthode professeur–élève et une implémentation pédagogique classique.
Relier les notions
Voyez où le modèle élève sera réellement utilisé.
Comprendre une notion
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.