Comment un petit modèle apprend à faire un travail aussi bien qu’un grand, ce que cela coûte, et quand c’est une mauvaise idée.
Guide conceptuel et opérationnel. Dernière revue : août 2026.
La distillation est la technique derrière la plupart des petits modèles qui dépassent leur catégorie, et derrière une bonne part des réductions de coût obtenues après une première année de production sur un modèle de pointe. Le mot recouvre plusieurs procédés différents, ce qui explique que deux ingénieurs puissent tomber d’accord sur le fait qu’ils « distillent un modèle » tout en parlant de choses incompatibles.
Cet article explique le mécanisme, les variantes, les résultats publiés et la décision elle-même. Il se lit à trois profondeurs :
Prérequis : savoir ce qu’est un token, ce que fait un fine-tuning, et ce que coûte un appel à un modèle hébergé. Aucune expérience d’entraînement n’est supposée avant la section sur le mécanisme, qui utilise des notations de probabilité.
La distillation entraîne un petit modèle, l’élève, à reproduire le comportement d’un grand modèle, l’enseignant, sur une tâche définie. C’est l’enseignant qui fournit le signal d’entraînement. Au lieu d’apprendre à partir d’étiquettes écrites par des humains, l’élève apprend de ce que produit l’enseignant : son texte généré, ses probabilités de sortie, ou son jugement sur les tentatives de l’élève.
Le résultat est un modèle moins cher et plus rapide à servir, généralement bon sur une seule tâche plutôt que sur tout. L’enseignant reste disponible pour les requêtes que l’élève ne sait pas traiter.
Geoffrey Hinton, Oriol Vinyals et Jeff Dean ont introduit la formulation moderne en 2015, pour des classifieurs d’images. Les modèles de langage en ont hérité, puis ont ajouté des variantes adaptées aux séquences de tokens plutôt qu’aux étiquettes uniques.

Figure 1. Les sept étapes d’un projet de distillation. La boucle compte plus que chaque étape prise isolément : sans l’étape 5, impossible de savoir si l’élève est prêt.
| À ne pas confondre : la distillation entraîne un nouveau modèle. La quantisation et l’élagage compressent un modèle existant sans changer ce qu’il a appris. La génération augmentée par récupération change ce que le modèle voit à l’inférence, pas ce qu’il sait. Ces techniques se combinent, mais elles règlent des problèmes différents. |
Quatre motivations reviennent, et elles ne sont pas également fréquentes.
| Motivation | À quoi cela ressemble en pratique |
|---|---|
| Coût unitaire | Une tâche de classification, d’extraction ou de routage s’exécute des millions de fois par mois sur un modèle de pointe. La même tâche sur un élève de 3 ou 8 milliards de paramètres coûte une fraction de ce montant. |
| Latence | La charge se trouve sur un chemin visible par l’utilisateur, où le temps jusqu’au premier token du grand modèle est trop long, ou bien où une longue trace de raisonnement ne vaut pas l’attente. |
| Localité et contrôle | Le modèle doit tourner dans un périmètre maîtrisé, sur votre matériel, sans transmettre de données à un tiers. Cela écarte le modèle de pointe et laisse un petit modèle qu’il faut instruire. |
| Récupération de comportement | Un modèle a été affiné sur des documents internes et a perdu la capacité à suivre les instructions qu’il avait avant. Une distillation depuis la version antérieure la restaure. |
La quatrième est la moins connue et la plus utile aux équipes internes. Elle est traitée en détail dans « Ce que disent les chiffres ».
L’équation économique ne tient que si la tâche est étroite. Un élève entraîné à égaler l’enseignant sur l’extraction de factures ne l’égalera sur rien d’autre, et chaque tâche ajoutée multiplie le travail d’entraînement et d’évaluation.
Trois procédés distincts circulent sous le même mot. Lire une page fournisseur ou un article sans savoir lequel est visé conduit à de fausses attentes sur le coût et la qualité.
| Nom | Ce que voit l’élève | Ce qu’il faut |
|---|---|---|
| Distillation des logits (boîte blanche) | La distribution de probabilité complète de l’enseignant sur le vocabulaire, à chaque position | Les poids de l’enseignant, ou une API qui renvoie les logits complets. Même tokeniseur, ou correspondance établie. |
| Distillation au niveau des séquences (boîte noire) | Uniquement le texte généré par l’enseignant. Fine-tuning supervisé classique sur ce texte. | Un accès API. C’est ce que font la plupart des services managés. |
| Distillation sur politique | La notation par l’enseignant, token par token, du texte que l’élève a lui-même produit | Pouvoir interroger les log-probabilités de l’enseignant sur des séquences arbitraires. |
Un quatrième usage est plus lâche : certaines équipes disent « nous avons distillé GPT dans notre modèle » alors qu’elles ont affiné sur quelques milliers de réponses de l’enseignant. C’est de la distillation au niveau des séquences, et l’appeler par son nom rend ses limites prévisibles.
Cette section suppose que vous voulez savoir pourquoi les méthodes diffèrent, pas seulement qu’elles diffèrent.
Une étiquette unique dit qu’un token était correct et que tous les autres étaient également faux. La distribution de l’enseignant dit davantage : elle classe les alternatives, et ce classement porte de l’information sur la structure de la tâche.

Figure 2. La même prédiction sous trois régimes de supervision. L’étiquette unique jette l’information selon laquelle « contrat » arrivait juste derrière et « carnet » était absurde.
L’article de Hinton appelle ces probabilités secondaires la connaissance sombre. Pour les rendre exploitables, on augmente la température du softmax, ce qui aplatit la distribution et remonte la queue informative au-dessus du plancher numérique. L’enseignant et l’élève sont adoucis par la même température pendant l’entraînement. L’élève est servi à température 1.
Les gradients produits par une distribution adoucie varient à peu près en 1/T², le terme de distillation est donc multiplié par T² pour que son poids reste stable quand la température change.
| import torch, torch.nn.functional as Fn def kd_loss(student_logits, teacher_logits, labels, T=2.0, alpha=0.7): “””KD hors ligne classique : cibles douces + etiquette dure.””” soft_t = Fn.softmax(teacher_logits / T, dim=-1) soft_s = Fn.log_softmax(student_logits / T, dim=-1) # KL directe (enseignant || eleve), mise a l’echelle pour rester comparable selon T kd = Fn.kl_div(soft_s, soft_t, reduction=”batchmean”) * (T * T) ce = Fn.cross_entropy(student_logits, labels) return alpha * kd + (1.0 – alpha) * ce |
Deux propriétés méritent d’être retenues. La perte vaut zéro quand les deux distributions sont identiques, et son ordre de grandeur reste comparable quand T varie, ce qui est tout l’intérêt du facteur T². Dans un modèle de langage, ce calcul s’applique position par position sur la séquence.
Le choix de la divergence décide de ce que fait l’élève lorsqu’il ne peut pas égaler l’enseignant partout, ce qui arrive souvent aux petits modèles.
| Divergence | Comportement | Conséquence |
|---|---|---|
| KL directe, enseignant par rapport à l’élève | Couvre les modes. L’élève étale sa masse de probabilité sur tout ce que l’enseignant pourrait dire. | Un élève de capacité insuffisante hésite et produit des sorties fades ou moyennées. |
| KL inverse, élève par rapport à l’enseignant | Cherche un mode. L’élève s’engage sur l’un des comportements de l’enseignant. | Sorties plus nettes et plus décidées. C’est ce qu’optimisent les méthodes sur politique. |
La KL inverse a un avantage pratique comme signal de récompense : elle ne se contourne pas. Une valeur faible signifie toujours que l’enseignant aurait accepté ce que l’élève a dit, ce qui n’est pas vrai d’un modèle de récompense appris.
Le second axe pèse plus lourd que la fonction de perte. Hors politique signifie que l’élève s’entraîne sur du texte écrit par l’enseignant. Sur politique signifie qu’il s’entraîne sur le texte qu’il a écrit lui-même, noté par l’enseignant.

Figure 3. Les deux axes qui séparent les méthodes. L’apprentissage par renforcement partage la colonne « sur politique » avec la distillation sur politique, mais il donne un nombre par déroulé au lieu d’un par token.
L’entraînement hors politique a un défaut qui s’aggrave à mesure que les sorties s’allongent. L’élève apprend à continuer depuis des états que l’enseignant visite. À l’inférence, il produira parfois un token que l’enseignant n’aurait jamais produit, et il se retrouve alors dans un territoire qu’aucun exemple ne couvrait. L’erreur s’amplifie.

Figure 4. À gauche : l’accumulation d’erreurs, parfois appelée biais d’exposition. À droite : la notation sur politique, où chaque token produit par l’élève reçoit un score de l’enseignant.
Un second problème, plus discret, tient à l’imitation du texte seul. Des travaux sur l’imitation de modèles propriétaires ont montré que l’élève acquiert le style et l’assurance de l’enseignant plus vite que sa justesse factuelle, ce qui flatte les évaluations humaines tout en laissant les scores de référence en retrait.
La distillation sur politique répond aux deux. L’élève échantillonne ses propres trajectoires, l’enseignant figé calcule les log-probabilités sur ces tokens exacts, et la KL inverse par token devient le signal d’entraînement. Le crédit revient au token qui a ouvert la mauvaise branche de raisonnement plutôt qu’à la réponse finale, souvent parfaitement prévisible compte tenu de ce qui la précède.
| # Distillation sur politique, adaptee de la recette du Tinker cookbookteacher = service.create_sampling_client(base_model=TEACHER) for step in range(n_steps): # 1. c’est l’ELEVE qui genere : c’est ce qui rend la methode sur politique traj = do_group_rollout(student_client, prompts) student_lp = traj.loss_fn_inputs[“logprobs”] # 2. l’enseignant fige note ces memes tokens (une seule passe avant) teacher_lp = teacher.compute_logprobs(traj) # 3. la KL inverse par token devient un avantage (negatif) par token traj[“advantages”] = -(student_lp – teacher_lp) # 4. mise a jour classique par gradient de politique training_client.forward_backward(traj, loss_fn=”importance_sampling”) |
Trois conséquences découlent de cette forme. Vous n’avez besoin ni d’un modèle de récompense séparé, ni d’annotateurs humains. Vous n’avez pas besoin d’attendre la fin d’un déroulé, puisque le score existe pour des séquences partielles, ce qui permet d’entraîner sur un contexte plus court que celui de l’évaluation. Et sur une pile d’apprentissage par renforcement qui régularise déjà contre un modèle de référence, le changement revient presque à remplacer le modèle qui joue ce rôle.
| Remarque : la KL inverse par token peut être négative sur un token échantillonné isolément. C’est l’espérance sous la distribution de l’élève qui est positive ou nulle, et c’est elle que la mise à jour optimise. |
La comparaison publiée la plus nette vient du rapport technique de Qwen3, où la même initialisation a été poussée plus loin par deux méthodes différentes.

Figure 5. Précision et coût de la dernière étape de post-entraînement. L’étape de distillation atteint un score supérieur à celui de l’étape d’apprentissage par renforcement pour environ un dixième des heures GPU.
Thinking Machines Lab a reproduit ce schéma de façon indépendante. En partant d’un élève affiné sur 400 000 prompts générés par l’enseignant, qui obtenait 60 % sur AIME 2024, la distillation sur politique a atteint 70 % en environ 150 étapes. Atteindre le même score en poursuivant le fine-tuning supervisé demandait, selon leur extrapolation, près de 2 millions de prompts. Comptée en FLOPs, la réduction va de 9 à 30 fois selon que vous possédez déjà ou non le jeu de données de fine-tuning.
Une expérience distincte d’auto-distillation isole l’effet de la densité du retour. Un modèle a été entraîné par renforcement, puis ce modèle entraîné a été distillé dans le modèle de base d’origine. La distillation a retrouvé le même score en 7 à 10 fois moins d’étapes de gradient.
Une expérience plus proche des déploiements internes : un assistant de 8 milliards de paramètres a reçu un entraînement intermédiaire sur les documents d’une entreprise pour lui transmettre la connaissance du domaine. Son score de connaissance est passé de 18 à 43 %. Son score de suivi d’instructions s’est effondré de 85 à 45 %. Mélanger 30 % de données de conversation générale a limité les dégâts sans jamais les effacer.
Une distillation sur politique depuis la version antérieure du modèle lui-même, en n’utilisant que des prompts de conversation générale et rien du corpus documentaire, a ramené le suivi d’instructions à 83 % pendant que la connaissance restait à 41 %. L’apprentissage documentaire et la réparation du comportement sont donc séparables, ce qui rend possible une boucle pratique : enseigner la connaissance nouvelle, réparer le comportement, recommencer à mesure que les documents changent.
| Étape | Connaissance interne | Suivi d’instructions |
|---|---|---|
| Modèle 8B d’origine | 18 % | 85 % |
| Après entraînement sur les documents internes seuls | 43 % | 45 % |
| Avec 30 % de conversation générale mélangée | 36 % | 79 % |
| Puis distillation sur politique depuis l’original | 41 % | 83 % |
Les services managés publient leurs propres chiffres, qui décrivent de la distillation au niveau des séquences et doivent se lire comme des affirmations commerciales plutôt que comme des résultats indépendants. AWS annonce que les modèles distillés sur Bedrock sont jusqu’à 500 % plus rapides et 75 % moins chers que l’original, avec moins de 2 % de perte de précision sur les cas d’usage à récupération augmentée. Prenez cela comme l’ordre de grandeur de l’opportunité, et mesurez votre propre tâche.
Côté recherche, les méthodes en boîte noire progressent. Microsoft Research a rapporté qu’un élève de 14 milliards de paramètres, entraîné par une variante antagoniste de la distillation sur politique et à partir du seul texte de l’enseignant, devenait comparable à son enseignant bien plus grand sur une évaluation automatique de conversation.
Parcourez ce tableau jusqu’à ce qu’une ligne corresponde à votre accès et à vos contraintes.
| Situation | Méthode | Remarque pratique |
|---|---|---|
| L’enseignant est un modèle à poids ouverts que vous pouvez héberger | Distillation des logits ou sur politique | Meilleure qualité par unité de calcul. Le tokeniseur doit correspondre, ou être mis en correspondance. |
| L’enseignant est une API commerciale, la tâche est étroite et stable | Niveau séquence, via un service de distillation managé | Effort minimal. Vérifiez les conditions avant de commencer. |
| L’élève doit récupérer un comportement perdu au fine-tuning | Distillation sur politique depuis un point de contrôle antérieur du même modèle | L’enseignant est ici votre propre modèle passé, ce qui supprime toute question de licence. |
| Vous visez du raisonnement, pas seulement le respect d’un format | Démarrage hors politique, puis sur politique | Le démarrage met le comportement de l’enseignant à portée de l’élève ; la phase sur politique le rend fiable. |
| Vous avez des prompts mais pas de réponses correctes | Échantillonnage par rejet, puis distillation | Générez de nombreuses réponses, gardez celles qu’un vérificateur accepte, entraînez sur celles-là. |
La plupart des charges qui ressemblent à des candidates à la distillation n’en sont pas. Passez les quatre vérifications avant d’écrire la moindre ligne de code d’entraînement.

Figure 6. Quatre vérifications dans l’ordre. Échouer à l’une d’elles appelle une réponse moins coûteuse que l’entraînement d’un modèle.
L’évaluation est la vérification que les équipes sautent, et c’est celle qui décide si le projet peut aboutir. Sans jeu d’évaluation noté, vous ne pourrez pas répondre à la seule question qui compte à la fin : l’élève est-il assez proche de l’enseignant pour prendre le relais ?
Avant de commencer, il vous faut : une tâche définie avec un format de sortie stable, au moins plusieurs centaines de prompts représentatifs et de préférence quelques milliers, un jeu d’évaluation noté disjoint des prompts d’entraînement, un modèle élève choisi, et la confirmation écrite que les conditions de l’enseignant autorisent ce que vous vous apprêtez à faire.
Si vous ne voulez pas posséder la boucle d’entraînement, trois services couvrent le cas « niveau séquence ».
La contrepartie est le contrôle. Certains de ces flux ne permettent pas d’exporter le fichier d’entraînement, et vous ne pouvez pas distiller vers un modèle que le fournisseur n’héberge pas.
| Symptôme | Cause probable | Que faire |
|---|---|---|
| Bon sur le jeu d’évaluation, mauvais en production | Les prompts d’entraînement venaient d’une distribution différente du trafic réel | Reconstruire le jeu de prompts à partir des journaux de production, entrées mal formées comprises |
| Fluide et assuré, mais moins juste | L’élève a imité le style plus vite que le fond, effet connu de l’imitation par le texte seul | Passer à une supervision par token, ou ajouter un vérificateur dans la boucle d’entraînement |
| Se dégrade uniquement sur les longues sorties | Accumulation d’erreurs due à l’entraînement hors politique | Basculer la phase finale en distillation sur politique |
| Capacités générales perdues après l’entraînement sur données internes | Oubli catastrophique pendant l’entraînement intermédiaire | Distiller depuis le point de contrôle antérieur sur des prompts généraux pour restaurer le comportement |
| Sorties fades ou évasives | KL directe avec une capacité insuffisante : le modèle couvre tous les modes | Utiliser la KL inverse, ou accepter que l’élève soit trop petit pour la tâche |
| Qualité en baisse après une mise à jour de l’enseignant | L’élève avait été figé face à une version antérieure | Épingler la version de l’enseignant et relancer l’évaluation à chaque changement |
La technique relève de l’apprentissage automatique ordinaire. L’exposition vient de la cible que vous lui donnez.
Le droit d’auteur est une base fragile dans la plupart des juridictions, car les sorties d’un modèle n’ont généralement pas la paternité humaine qu’il exige. Les questions vives sont contractuelles et, de plus en plus, relèvent du secret des affaires. La plupart des fournisseurs de pointe interdisent d’utiliser leurs sorties pour entraîner des modèles concurrents, et certains interdisent d’entraîner un modèle quelconque sur leurs sorties sans autorisation.
Deux litiges ont rendu cela concret. OpenAI a accusé DeepSeek d’avoir utilisé ses modèles pour entraîner un concurrent en violation de ses conditions d’utilisation. Anthropic a ensuite déclaré avoir identifié des campagnes à grande échelle menées par DeepSeek, Moonshot et MiniMax pour extraire les capacités de Claude via des milliers de comptes frauduleux, tout en reconnaissant que la distillation est une méthode d’entraînement légitime. Aucun de ces dossiers ne portait sur la licéité de la technique elle-même.
Positions pratiques, de la plus sûre à la plus risquée :
En environnement régulé, ajoutez la documentation au livrable : modèle enseignant et version, provenance des prompts, paramètres de génération, résultats d’évaluation et revue de licence. Un modèle distillé est un actif dérivé, et sa traçabilité a sa place dans l’inventaire des modèles.
Si la distillation convient à votre charge, l’expérience utile la plus rapide est modeste : prenez une tâche à fort volume, construisez le jeu d’évaluation de 200 cas, et lancez une distillation au niveau des séquences via un service managé. Cela répond à la question économique en quelques jours. Le travail sur politique ne mérite l’effort supplémentaire qu’une fois connue la taille du gain.
Hinton, Vinyals et Dean, Distilling the Knowledge in a Neural Network (2015). L’origine des cibles douces et de la température.
Kim et Rush, Sequence-Level Knowledge Distillation (2016). L’adaptation aux modèles de séquences.
Agarwal et al., On-Policy Distillation of Language Models (2023), et Gu et al., MiniLLM (2023). Les fondations sur politique et KL inverse.
Gudibande et al., The False Promise of Imitating Proprietary LLMs (2023). Pourquoi le style se transmet plus vite que la justesse.
Thinking Machines Lab, On-Policy Distillation (2025), avec des recettes exécutables dans le Tinker cookbook.
Qwen Team, Qwen3 Technical Report (2025). Source de la comparaison précision / heures GPU.
AWS, Customize a model with distillation in Amazon Bedrock, et OpenAI, Model Distillation in the API. Les flux managés.
Fenwick, DeepSeek, Model Distillation, and the Future of AI IP Protection. Un panorama juridique des arguments contractuels et de secret des affaires.