Distillation on-policy | Réunir EOPD et ToDi dans une même famille
Un résultat de 33 sur 36, publié avec l'astérisque des auteurs eux-mêmes
Une famille à quatre coefficients pour pondérer les pertes par token en distillation on-policy dépasse les références à canal unique dans 33 des 36 cellules. Les auteurs qualifient ensuite leurs propres décomptes de preuves directionnelles et leurs réplications à trois graines de non significatives.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-09-20 · 4 min de lecture

L'article est apparu dans la liste cs.AI d'arXiv le 10 septembre 2026 sous un titre qui dit ce qu'il fait : « A Unified Per-Token Gating Family for On-Policy Distillation: FKL/RKL Mixing with Multi-Channel and Bias Coefficients ». Son objet central est une équation, lambda_t = sigma(a * h_t + b * u(x) + c + d * gap_t), qui fixe le poids porté par la perte KL directe ou inverse à chaque token pendant la distillation.
Les expériences associent un enseignant Qwen3-32B à un étudiant Qwen3-4B sur TweetEval (Barbieri et al., 2020), sur les tâches emotion et hate. Des configurations issues de la famille complète à quatre coefficients ont atteint une exactitude supérieure à celle de restrictions à canal unique de magnitude appariée, les portes entropy-only et gap-only, dans 33 des 36 cellules comparables. Une seconde campagne, une expérience d'isolement par appariement des moyennes portant sur 26 cellules, a placé le gating dynamique devant des références statiques appariées selon la KL effective dans 19 des 26 cellules.
Un système de coordonnées partagé, non un remplacement
Aucune des deux conceptions que la famille absorbe n'est nouvelle. EOPD (Jin et al., 2026) et ToDi (Jung et al., 2025) fixent chacune un signal de gating unique et une direction de gating unique, et le résumé indique clairement que les deux n'ont jamais été comparées directement. Dans la nouvelle paramétrisation, chacune apparaît comme une restriction unidimensionnelle de la même équation, ce qui permet à une seule campagne de couvrir les deux.
Les auteurs la présentent comme un système de coordonnées plutôt que comme un successeur. Selon leurs termes, la paramétrisation est proposée « primarily as a shared coordinate system for comparing per-token gating designs in short-output classification OPD ». Ce que la famille ajoute au-delà des deux conceptions plus anciennes, c'est une composition multicanal et un biais explicite, ainsi que le mélange KL direct/inverse mentionné dans le titre.
La mise en garde rédigée par les auteurs eux-mêmes
Les deux décomptes phares proviennent de cellules qui partagent les données d'entraînement, les modèles et la sous-structure des paramètres. Les auteurs le signalent avant que tout lecteur ne le fasse, en rapportant les deux décomptes comme « exploratory aggregate directional evidence rather than as independent hypothesis tests ». Des cellules de ce type ne sont pas des échantillons indépendants : les chiffres décrivent donc dans quelle direction penche la campagne, et non la fiabilité avec laquelle le résultat se reproduirait.
Ils ont aussi repris leurs expériences pour les répliquer. Les neuf comparaisons phares isolées par la première campagne ont été relancées avec trois graines appariées, et une troisième tâche, offensive, a été ajoutée. Les écarts ont conservé leur direction mais se sont réduits : chaque effet répliqué s'est révélé plus petit que l'estimation à graine unique, et aucun n'était significatif à n = 3.
| Bloc de preuves | Comparaison | Résultat | Qualification des auteurs eux-mêmes |
|---|---|---|---|
| Campagne principale | Famille complète vs. restrictions 1D à canal unique de magnitude appariée (entropy-only, gap-only) | Exactitude supérieure dans 33 des 36 cellules comparables | Preuve directionnelle agrégée exploratoire |
| Isolement par appariement des moyennes | Gating dynamique vs. références statiques appariées selon la KL effective | En tête dans 19 des 26 cellules | Preuve directionnelle agrégée exploratoire |
| Réplication à trois graines | Neuf comparaisons phares, plus la tâche offensive | Directionnellement cohérent, plus petit que les estimations à graine unique | Non significatif à n = 3 |
Où il se situe face à EOPD et ToDi
Le gating par token des pertes KL directe et inverse est une technique standard en distillation on-policy depuis assez longtemps pour que les conceptions se figent autour de signaux uniques. La lacune que comble cet article est étroite et réelle : deux de ces conceptions n'avaient jamais été placées côte à côte. Savoir si cela compte comme un progrès dépend de ce que le lecteur cherchait. Le résumé ne revendique aucun nouvel état de l'art et ne dit pas si EOPD ou ToDi ont été relancées dans des conditions appariées, ni si leurs chiffres publiés ont été reproduits. Toutes les comparaisons rapportées restent à l'intérieur de cette seule famille, sur ce seul couple enseignant-étudiant.
L'article se lit donc comme une consolidation assortie d'une règle de mesure, et non comme une avancée démontrée à grande échelle par rapport à l'une ou l'autre des conceptions antérieures. Le cadrage garde néanmoins de la valeur, car toute conception de gating qui peut s'écrire sous forme de coefficients dans cette famille peut être placée sur le même axe que les autres.
Ce que les équipes qui choisissent une porte obtiennent réellement
La portée est la première chose qu'un praticien devrait vérifier. Les preuves couvrent la classification à sorties courtes sur trois tâches : emotion et hate issues de TweetEval, plus offensive. Elles couvrent un seul enseignant, Qwen3-32B, distillant vers un seul étudiant, Qwen3-4B. Le résumé ne rapporte rien sur la génération longue, les travaux à forte composante de raisonnement ou d'autres familles de modèles, et il ne dit pas comment les coefficients ont été réglés ni ce que la campagne a coûté en calcul.
Ce qu'une équipe obtient, c'est un moyen d'énoncer un choix de gating sous forme de quatre nombres plutôt que comme un fork du code d'entraînement de quelqu'un d'autre, ce qui rend ce choix facile à balayer et facile à documenter. Ce qu'elle n'obtient pas, c'est une décision sur le signal de gating qui l'emporte. Les auteurs qualifient leur propre marge de directionnelle et présentent le cadre comme un outil de comparaison. Quiconque espère un verdict sur la porte à déployer n'en trouvera pas ici, et l'article ne prétend pas le contraire.
- Source : A 33-of-36 result, published with the authors' own asterisk — 2026-09-10
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.