La distillation de modèles de langage

SAMI
August 9, 2026 22 mins to read
Share

Comment un petit modèle apprend à faire un travail aussi bien qu’un grand, ce que cela coûte, et quand c’est une mauvaise idée.

Guide conceptuel et opérationnel. Dernière revue : août 2026.

Ce que couvre cet article

La distillation est la technique derrière la plupart des petits modèles qui dépassent leur catégorie, et derrière une bonne part des réductions de coût obtenues après une première année de production sur un modèle de pointe. Le mot recouvre plusieurs procédés différents, ce qui explique que deux ingénieurs puissent tomber d’accord sur le fait qu’ils « distillent un modèle » tout en parlant de choses incompatibles.

Cet article explique le mécanisme, les variantes, les résultats publiés et la décision elle-même. Il se lit à trois profondeurs :

  • Si vous arbitrez des budgets : lisez « Pourquoi distiller », « Ce que disent les chiffres », « Décider de distiller ou non » et « Licences, conditions et risque ».
  • Si vous construisez avec des modèles : ajoutez « Un problème de vocabulaire », « Choisir une approche » et « Conduire un projet de distillation ».
  • Si vous entraînez des modèles : lisez tout, y compris « Le mécanisme en détail ».

Prérequis : savoir ce qu’est un token, ce que fait un fine-tuning, et ce que coûte un appel à un modèle hébergé. Aucune expérience d’entraînement n’est supposée avant la section sur le mécanisme, qui utilise des notations de probabilité.

Ce qu’est la distillation

La distillation entraîne un petit modèle, l’élève, à reproduire le comportement d’un grand modèle, l’enseignant, sur une tâche définie. C’est l’enseignant qui fournit le signal d’entraînement. Au lieu d’apprendre à partir d’étiquettes écrites par des humains, l’élève apprend de ce que produit l’enseignant : son texte généré, ses probabilités de sortie, ou son jugement sur les tentatives de l’élève.

Le résultat est un modèle moins cher et plus rapide à servir, généralement bon sur une seule tâche plutôt que sur tout. L’enseignant reste disponible pour les requêtes que l’élève ne sait pas traiter.

Geoffrey Hinton, Oriol Vinyals et Jeff Dean ont introduit la formulation moderne en 2015, pour des classifieurs d’images. Les modèles de langage en ont hérité, puis ont ajouté des variantes adaptées aux séquences de tokens plutôt qu’aux étiquettes uniques.

Figure 1. Les sept étapes d’un projet de distillation. La boucle compte plus que chaque étape prise isolément : sans l’étape 5, impossible de savoir si l’élève est prêt.

À ne pas confondre : la distillation entraîne un nouveau modèle. La quantisation et l’élagage compressent un modèle existant sans changer ce qu’il a appris. La génération augmentée par récupération change ce que le modèle voit à l’inférence, pas ce qu’il sait. Ces techniques se combinent, mais elles règlent des problèmes différents.

Pourquoi distiller

Quatre motivations reviennent, et elles ne sont pas également fréquentes.

MotivationÀ quoi cela ressemble en pratique
Coût unitaireUne tâche de classification, d’extraction ou de routage s’exécute des millions de fois par mois sur un modèle de pointe. La même tâche sur un élève de 3 ou 8 milliards de paramètres coûte une fraction de ce montant.
LatenceLa charge se trouve sur un chemin visible par l’utilisateur, où le temps jusqu’au premier token du grand modèle est trop long, ou bien où une longue trace de raisonnement ne vaut pas l’attente.
Localité et contrôleLe modèle doit tourner dans un périmètre maîtrisé, sur votre matériel, sans transmettre de données à un tiers. Cela écarte le modèle de pointe et laisse un petit modèle qu’il faut instruire.
Récupération de comportementUn modèle a été affiné sur des documents internes et a perdu la capacité à suivre les instructions qu’il avait avant. Une distillation depuis la version antérieure la restaure.

La quatrième est la moins connue et la plus utile aux équipes internes. Elle est traitée en détail dans « Ce que disent les chiffres ».

L’équation économique ne tient que si la tâche est étroite. Un élève entraîné à égaler l’enseignant sur l’extraction de factures ne l’égalera sur rien d’autre, et chaque tâche ajoutée multiplie le travail d’entraînement et d’évaluation.

Un problème de vocabulaire

Trois procédés distincts circulent sous le même mot. Lire une page fournisseur ou un article sans savoir lequel est visé conduit à de fausses attentes sur le coût et la qualité.

NomCe que voit l’élèveCe qu’il faut
Distillation des logits (boîte blanche)La distribution de probabilité complète de l’enseignant sur le vocabulaire, à chaque positionLes poids de l’enseignant, ou une API qui renvoie les logits complets. Même tokeniseur, ou correspondance établie.
Distillation au niveau des séquences (boîte noire)Uniquement le texte généré par l’enseignant. Fine-tuning supervisé classique sur ce texte.Un accès API. C’est ce que font la plupart des services managés.
Distillation sur politiqueLa notation par l’enseignant, token par token, du texte que l’élève a lui-même produitPouvoir interroger les log-probabilités de l’enseignant sur des séquences arbitraires.

Un quatrième usage est plus lâche : certaines équipes disent « nous avons distillé GPT dans notre modèle » alors qu’elles ont affiné sur quelques milliers de réponses de l’enseignant. C’est de la distillation au niveau des séquences, et l’appeler par son nom rend ses limites prévisibles.

Le mécanisme en détail

Cette section suppose que vous voulez savoir pourquoi les méthodes diffèrent, pas seulement qu’elles diffèrent.

Cibles douces et température

Une étiquette unique dit qu’un token était correct et que tous les autres étaient également faux. La distribution de l’enseignant dit davantage : elle classe les alternatives, et ce classement porte de l’information sur la structure de la tâche.

Figure 2. La même prédiction sous trois régimes de supervision. L’étiquette unique jette l’information selon laquelle « contrat » arrivait juste derrière et « carnet » était absurde.

L’article de Hinton appelle ces probabilités secondaires la connaissance sombre. Pour les rendre exploitables, on augmente la température du softmax, ce qui aplatit la distribution et remonte la queue informative au-dessus du plancher numérique. L’enseignant et l’élève sont adoucis par la même température pendant l’entraînement. L’élève est servi à température 1.

Les gradients produits par une distribution adoucie varient à peu près en 1/T², le terme de distillation est donc multiplié par T² pour que son poids reste stable quand la température change.

import torch, torch.nn.functional as Fn
def kd_loss(student_logits, teacher_logits, labels, T=2.0, alpha=0.7):    “””KD hors ligne classique : cibles douces + etiquette dure.”””    soft_t = Fn.softmax(teacher_logits / T, dim=-1)    soft_s = Fn.log_softmax(student_logits / T, dim=-1)    # KL directe (enseignant || eleve), mise a l’echelle pour rester comparable selon T    kd = Fn.kl_div(soft_s, soft_t, reduction=”batchmean”) * (T * T)    ce = Fn.cross_entropy(student_logits, labels)    return alpha * kd + (1.0 – alpha) * ce

Deux propriétés méritent d’être retenues. La perte vaut zéro quand les deux distributions sont identiques, et son ordre de grandeur reste comparable quand T varie, ce qui est tout l’intérêt du facteur T². Dans un modèle de langage, ce calcul s’applique position par position sur la séquence.

Quelle divergence, et pourquoi cela compte

Le choix de la divergence décide de ce que fait l’élève lorsqu’il ne peut pas égaler l’enseignant partout, ce qui arrive souvent aux petits modèles.

DivergenceComportementConséquence
KL directe, enseignant par rapport à l’élèveCouvre les modes. L’élève étale sa masse de probabilité sur tout ce que l’enseignant pourrait dire.Un élève de capacité insuffisante hésite et produit des sorties fades ou moyennées.
KL inverse, élève par rapport à l’enseignantCherche un mode. L’élève s’engage sur l’un des comportements de l’enseignant.Sorties plus nettes et plus décidées. C’est ce qu’optimisent les méthodes sur politique.

La KL inverse a un avantage pratique comme signal de récompense : elle ne se contourne pas. Une valeur faible signifie toujours que l’enseignant aurait accepté ce que l’élève a dit, ce qui n’est pas vrai d’un modèle de récompense appris.

Qui écrit le texte d’entraînement

Le second axe pèse plus lourd que la fonction de perte. Hors politique signifie que l’élève s’entraîne sur du texte écrit par l’enseignant. Sur politique signifie qu’il s’entraîne sur le texte qu’il a écrit lui-même, noté par l’enseignant.

Figure 3. Les deux axes qui séparent les méthodes. L’apprentissage par renforcement partage la colonne « sur politique » avec la distillation sur politique, mais il donne un nombre par déroulé au lieu d’un par token.

L’entraînement hors politique a un défaut qui s’aggrave à mesure que les sorties s’allongent. L’élève apprend à continuer depuis des états que l’enseignant visite. À l’inférence, il produira parfois un token que l’enseignant n’aurait jamais produit, et il se retrouve alors dans un territoire qu’aucun exemple ne couvrait. L’erreur s’amplifie.

Figure 4. À gauche : l’accumulation d’erreurs, parfois appelée biais d’exposition. À droite : la notation sur politique, où chaque token produit par l’élève reçoit un score de l’enseignant.

Un second problème, plus discret, tient à l’imitation du texte seul. Des travaux sur l’imitation de modèles propriétaires ont montré que l’élève acquiert le style et l’assurance de l’enseignant plus vite que sa justesse factuelle, ce qui flatte les évaluations humaines tout en laissant les scores de référence en retrait.

La distillation sur politique répond aux deux. L’élève échantillonne ses propres trajectoires, l’enseignant figé calcule les log-probabilités sur ces tokens exacts, et la KL inverse par token devient le signal d’entraînement. Le crédit revient au token qui a ouvert la mauvaise branche de raisonnement plutôt qu’à la réponse finale, souvent parfaitement prévisible compte tenu de ce qui la précède.

# Distillation sur politique, adaptee de la recette du Tinker cookbookteacher = service.create_sampling_client(base_model=TEACHER)
for step in range(n_steps):    # 1. c’est l’ELEVE qui genere : c’est ce qui rend la methode sur politique    traj = do_group_rollout(student_client, prompts)    student_lp = traj.loss_fn_inputs[“logprobs”]
    # 2. l’enseignant fige note ces memes tokens (une seule passe avant)    teacher_lp = teacher.compute_logprobs(traj)
    # 3. la KL inverse par token devient un avantage (negatif) par token    traj[“advantages”] = -(student_lp – teacher_lp)
    # 4. mise a jour classique par gradient de politique    training_client.forward_backward(traj, loss_fn=”importance_sampling”)

Trois conséquences découlent de cette forme. Vous n’avez besoin ni d’un modèle de récompense séparé, ni d’annotateurs humains. Vous n’avez pas besoin d’attendre la fin d’un déroulé, puisque le score existe pour des séquences partielles, ce qui permet d’entraîner sur un contexte plus court que celui de l’évaluation. Et sur une pile d’apprentissage par renforcement qui régularise déjà contre un modèle de référence, le changement revient presque à remplacer le modèle qui joue ce rôle.

Remarque : la KL inverse par token peut être négative sur un token échantillonné isolément. C’est l’espérance sous la distribution de l’élève qui est positive ou nulle, et c’est elle que la mise à jour optimise.

Ce que disent les chiffres

La comparaison publiée la plus nette vient du rapport technique de Qwen3, où la même initialisation a été poussée plus loin par deux méthodes différentes.

Figure 5. Précision et coût de la dernière étape de post-entraînement. L’étape de distillation atteint un score supérieur à celui de l’étape d’apprentissage par renforcement pour environ un dixième des heures GPU.

Thinking Machines Lab a reproduit ce schéma de façon indépendante. En partant d’un élève affiné sur 400 000 prompts générés par l’enseignant, qui obtenait 60 % sur AIME 2024, la distillation sur politique a atteint 70 % en environ 150 étapes. Atteindre le même score en poursuivant le fine-tuning supervisé demandait, selon leur extrapolation, près de 2 millions de prompts. Comptée en FLOPs, la réduction va de 9 à 30 fois selon que vous possédez déjà ou non le jeu de données de fine-tuning.

Une expérience distincte d’auto-distillation isole l’effet de la densité du retour. Un modèle a été entraîné par renforcement, puis ce modèle entraîné a été distillé dans le modèle de base d’origine. La distillation a retrouvé le même score en 7 à 10 fois moins d’étapes de gradient.

Le cas que reconnaîtront les entreprises

Une expérience plus proche des déploiements internes : un assistant de 8 milliards de paramètres a reçu un entraînement intermédiaire sur les documents d’une entreprise pour lui transmettre la connaissance du domaine. Son score de connaissance est passé de 18 à 43 %. Son score de suivi d’instructions s’est effondré de 85 à 45 %. Mélanger 30 % de données de conversation générale a limité les dégâts sans jamais les effacer.

Une distillation sur politique depuis la version antérieure du modèle lui-même, en n’utilisant que des prompts de conversation générale et rien du corpus documentaire, a ramené le suivi d’instructions à 83 % pendant que la connaissance restait à 41 %. L’apprentissage documentaire et la réparation du comportement sont donc séparables, ce qui rend possible une boucle pratique : enseigner la connaissance nouvelle, réparer le comportement, recommencer à mesure que les documents changent.

ÉtapeConnaissance interneSuivi d’instructions
Modèle 8B d’origine18 %85 %
Après entraînement sur les documents internes seuls43 %45 %
Avec 30 % de conversation générale mélangée36 %79 %
Puis distillation sur politique depuis l’original41 %83 %

Les chiffres des fournisseurs

Les services managés publient leurs propres chiffres, qui décrivent de la distillation au niveau des séquences et doivent se lire comme des affirmations commerciales plutôt que comme des résultats indépendants. AWS annonce que les modèles distillés sur Bedrock sont jusqu’à 500 % plus rapides et 75 % moins chers que l’original, avec moins de 2 % de perte de précision sur les cas d’usage à récupération augmentée. Prenez cela comme l’ordre de grandeur de l’opportunité, et mesurez votre propre tâche.

Côté recherche, les méthodes en boîte noire progressent. Microsoft Research a rapporté qu’un élève de 14 milliards de paramètres, entraîné par une variante antagoniste de la distillation sur politique et à partir du seul texte de l’enseignant, devenait comparable à son enseignant bien plus grand sur une évaluation automatique de conversation.

Choisir une approche

Parcourez ce tableau jusqu’à ce qu’une ligne corresponde à votre accès et à vos contraintes.

SituationMéthodeRemarque pratique
L’enseignant est un modèle à poids ouverts que vous pouvez hébergerDistillation des logits ou sur politiqueMeilleure qualité par unité de calcul. Le tokeniseur doit correspondre, ou être mis en correspondance.
L’enseignant est une API commerciale, la tâche est étroite et stableNiveau séquence, via un service de distillation managéEffort minimal. Vérifiez les conditions avant de commencer.
L’élève doit récupérer un comportement perdu au fine-tuningDistillation sur politique depuis un point de contrôle antérieur du même modèleL’enseignant est ici votre propre modèle passé, ce qui supprime toute question de licence.
Vous visez du raisonnement, pas seulement le respect d’un formatDémarrage hors politique, puis sur politiqueLe démarrage met le comportement de l’enseignant à portée de l’élève ; la phase sur politique le rend fiable.
Vous avez des prompts mais pas de réponses correctesÉchantillonnage par rejet, puis distillationGénérez de nombreuses réponses, gardez celles qu’un vérificateur accepte, entraînez sur celles-là.

Décider de distiller ou non

La plupart des charges qui ressemblent à des candidates à la distillation n’en sont pas. Passez les quatre vérifications avant d’écrire la moindre ligne de code d’entraînement.

Figure 6. Quatre vérifications dans l’ordre. Échouer à l’une d’elles appelle une réponse moins coûteuse que l’entraînement d’un modèle.

L’évaluation est la vérification que les équipes sautent, et c’est celle qui décide si le projet peut aboutir. Sans jeu d’évaluation noté, vous ne pourrez pas répondre à la seule question qui compte à la fin : l’élève est-il assez proche de l’enseignant pour prendre le relais ?

Conduire un projet de distillation

Avant de commencer, il vous faut : une tâche définie avec un format de sortie stable, au moins plusieurs centaines de prompts représentatifs et de préférence quelques milliers, un jeu d’évaluation noté disjoint des prompts d’entraînement, un modèle élève choisi, et la confirmation écrite que les conditions de l’enseignant autorisent ce que vous vous apprêtez à faire.

  1. Figez la tâche. Écrivez le format d’entrée, le format de sortie et les critères d’acceptation. Tout ce qui bouge encore invalidera l’entraînement.
  2. Construisez le jeu d’évaluation en premier. Prenez 200 à 500 cas réels, obtenez les réponses de l’enseignant, faites-les valider par un humain, et gardez ce jeu hors de l’entraînement.
  3. Mesurez l’enseignant sur ce jeu. C’est votre plafond et votre référence budgétaire, en coût pour mille appels et en latence p95.
  4. Collectez les prompts. Les journaux de production valent mieux que des prompts synthétiques, car ils portent la distribution réelle, y compris les entrées mal formées.
  5. Générez les données d’entraînement. Échantillonnez les réponses de l’enseignant à basse température pour les tâches déterministes, plus haute quand la diversité aide. Conservez la version de l’enseignant avec les données.
  6. Entraînez l’élève. Commencez par un fine-tuning supervisé sur les sorties de l’enseignant. LoRA suffit en général pour les tâches étroites et coûte moins cher à itérer.
  7. Évaluez contre le jeu figé. Comparez à l’enseignant, pas à une cible abstraite. Rapportez l’écart par catégorie, pas seulement la moyenne.
  8. Si l’écart est trop grand, ajoutez de la supervision plutôt que des données. Le volume de prompts suit une courbe log-linéaire à rendement décroissant ; la supervision par token sur les sorties de l’élève est le changement de palier.
  9. Déployez derrière un routeur. Envoyez la charge à l’élève, gardez l’enseignant pour les requêtes peu sûres ou hors distribution, et journalisez les deux.
  10. Réévaluez à échéance régulière. Les distributions d’entrée dérivent, et un élève entraîné sur le trafic du trimestre précédent se dégrade en silence.

Les voies managées

Si vous ne voulez pas posséder la boucle d’entraînement, trois services couvrent le cas « niveau séquence ».

  • Amazon Bedrock Model Distillation. Vous fournissez les prompts, le service génère les réponses de l’enseignant, synthétise des données supplémentaires, affine l’élève et héberge le résultat.
  • OpenAI stored completions. Activez store sur les appels de production, filtrez les paires stockées dans le tableau de bord, puis lancez un fine-tuning à partir de la sélection.
  • Azure AI Foundry stored completions. Le même schéma dans Azure. Dix complétions stockées suffisent techniquement, même si quelques centaines à quelques milliers sont recommandées.

La contrepartie est le contrôle. Certains de ces flux ne permettent pas d’exporter le fichier d’entraînement, et vous ne pouvez pas distiller vers un modèle que le fournisseur n’héberge pas.

Quand l’élève déçoit

SymptômeCause probableQue faire
Bon sur le jeu d’évaluation, mauvais en productionLes prompts d’entraînement venaient d’une distribution différente du trafic réelReconstruire le jeu de prompts à partir des journaux de production, entrées mal formées comprises
Fluide et assuré, mais moins justeL’élève a imité le style plus vite que le fond, effet connu de l’imitation par le texte seulPasser à une supervision par token, ou ajouter un vérificateur dans la boucle d’entraînement
Se dégrade uniquement sur les longues sortiesAccumulation d’erreurs due à l’entraînement hors politiqueBasculer la phase finale en distillation sur politique
Capacités générales perdues après l’entraînement sur données internesOubli catastrophique pendant l’entraînement intermédiaireDistiller depuis le point de contrôle antérieur sur des prompts généraux pour restaurer le comportement
Sorties fades ou évasivesKL directe avec une capacité insuffisante : le modèle couvre tous les modesUtiliser la KL inverse, ou accepter que l’élève soit trop petit pour la tâche
Qualité en baisse après une mise à jour de l’enseignantL’élève avait été figé face à une version antérieureÉpingler la version de l’enseignant et relancer l’évaluation à chaque changement

Licences, conditions et risque

La technique relève de l’apprentissage automatique ordinaire. L’exposition vient de la cible que vous lui donnez.

Le droit d’auteur est une base fragile dans la plupart des juridictions, car les sorties d’un modèle n’ont généralement pas la paternité humaine qu’il exige. Les questions vives sont contractuelles et, de plus en plus, relèvent du secret des affaires. La plupart des fournisseurs de pointe interdisent d’utiliser leurs sorties pour entraîner des modèles concurrents, et certains interdisent d’entraîner un modèle quelconque sur leurs sorties sans autorisation.

Deux litiges ont rendu cela concret. OpenAI a accusé DeepSeek d’avoir utilisé ses modèles pour entraîner un concurrent en violation de ses conditions d’utilisation. Anthropic a ensuite déclaré avoir identifié des campagnes à grande échelle menées par DeepSeek, Moonshot et MiniMax pour extraire les capacités de Claude via des milliers de comptes frauduleux, tout en reconnaissant que la distillation est une méthode d’entraînement légitime. Aucun de ces dossiers ne portait sur la licéité de la technique elle-même.

Positions pratiques, de la plus sûre à la plus risquée :

  • Votre propre modèle comme enseignant. Aucune condition tierce en jeu. Cela couvre entièrement le cas de la récupération de comportement.
  • Un enseignant à poids ouverts. Lisez la licence : plusieurs licences communautaires autorisent la distillation mais exigent de nommer le modèle d’origine dans le nom du modèle dérivé et dans l’attribution.
  • Une API commerciale via le produit de distillation du fournisseur lui-même. Autorisé par construction, dans l’écosystème de ce fournisseur.
  • Une API commerciale utilisée pour générer des données d’entraînement pour un modèle interne non concurrent. C’est la zone grise. Faites relire les conditions avant de commencer, pas après.
  • Une API commerciale utilisée pour entraîner un produit concurrent du fournisseur. Interdit par pratiquement toutes les conditions.

En environnement régulé, ajoutez la documentation au livrable : modèle enseignant et version, provenance des prompts, paramètres de génération, résultats d’évaluation et revue de licence. Un modèle distillé est un actif dérivé, et sa traçabilité a sa place dans l’inventaire des modèles.

Quand ne pas distiller

  • La tâche est large. Un assistant généraliste a besoin de capacités générales, et un petit élève perdra la longue traîne que vous n’avez pas entraînée.
  • Les exigences changent tous les mois. Chaque changement impose un nouvel entraînement et un nouveau cycle d’évaluation.
  • Le problème est un manque de connaissance plutôt qu’un manque de comportement. La récupération documentaire coûte moins cher et se maintient plus facilement à jour.
  • Le volume est faible. En dessous de quelques centaines de milliers d’appels par mois, le temps d’ingénierie coûtera plus que l’inférence économisée.
  • Vous n’avez pas de jeu d’évaluation et pas l’envie d’en construire un. Vous ne saurez pas dire si l’élève est assez bon.

Prochaines étapes

Si la distillation convient à votre charge, l’expérience utile la plus rapide est modeste : prenez une tâche à fort volume, construisez le jeu d’évaluation de 200 cas, et lancez une distillation au niveau des séquences via un service managé. Cela répond à la question économique en quelques jours. Le travail sur politique ne mérite l’effort supplémentaire qu’une fois connue la taille du gain.

Pour aller plus loin

Hinton, Vinyals et Dean, Distilling the Knowledge in a Neural Network (2015). L’origine des cibles douces et de la température.

Kim et Rush, Sequence-Level Knowledge Distillation (2016). L’adaptation aux modèles de séquences.

Agarwal et al., On-Policy Distillation of Language Models (2023), et Gu et al., MiniLLM (2023). Les fondations sur politique et KL inverse.

Gudibande et al., The False Promise of Imitating Proprietary LLMs (2023). Pourquoi le style se transmet plus vite que la justesse.

Thinking Machines Lab, On-Policy Distillation (2025), avec des recettes exécutables dans le Tinker cookbook.

Qwen Team, Qwen3 Technical Report (2025). Source de la comparaison précision / heures GPU.

AWS, Customize a model with distillation in Amazon Bedrock, et OpenAI, Model Distillation in the API. Les flux managés.

Fenwick, DeepSeek, Model Distillation, and the Future of AI IP Protection. Un panorama juridique des arguments contractuels et de secret des affaires.

Leave a comment

Your email address will not be published. Required fields are marked *