Interprétabilité des LLM : préprint arXiv, 10 septembre 2026
Qwen, Llama et Gemma divergent sur le moment où un modèle cesse de router et commence à répondre
Le préprint 'From Parameters to Answers' sépare ce qu'un modèle peut lire tôt de ce qui oriente réellement sa sortie. Entre Qwen, Llama et Gemma, les trajectoires diffèrent, et une direction de requête conserve un effet tardif qu'un simple récit opposant précocité et tardiveté ne peut expliquer.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-09-20 · 4 min de lecture

Ce que le préprint a réellement fait
La question est mécanique : lorsqu'un modèle de langue répond, comment sa dépendance aux informations de routage de requête change-t-elle par rapport à sa dépendance aux connaissances qui étayent la réponse ? From Parameters to Answers, soumis à arXiv le 10 septembre 2026, l'aborde en intervenant sur l'état caché à la fin de la question, couche par couche, plutôt qu'en lisant la sortie du modèle et en remontant à partir d'elle.
L'équipe compare des questions pays-continent avec des réponses sous forme de nom, d'adjectif et de code, en gardant distinctes plusieurs mesures ajustées. Deux directions de requête reçoivent des noms. Une direction de requête conditionnée par paire décrit quel pays est interrogé dans des questions naturelles portant sur un seul pays. Une direction de requête globale décrit les requêtes portant sur un premier pays par rapport à un second dans des questions appariées. Des candidats de sélection distincts testent le contrôle parmi des contenus déjà disponibles dans l'état caché.
Les trois modèles n'apparaissent que comme familles. Le document nomme Qwen, Llama et Gemma, sans variante, taille ni point de contrôle, de sorte que rien ici ne doit être lu comme une affirmation sur une version spécifique.
Qwen, Llama et Gemma ne basculent pas selon le même calendrier
Les trajectoires appariées des trois modèles ne sont pas uniformes, et c'est le premier résultat à retenir de l'article. Gemma présente un profil de routage-contenu en couches intermédiaires partiellement chevauchant, que le résumé rapporte sans décomposition supplémentaire. Llama n'a pas de fenêtre d'effet de routage soutenue sous les mêmes critères.
Il s'agit d'une divergence de nature plutôt que de degré. Quiconque supposait que les trois familles partagent un calendrier couche par couche pour le routage et le contenu se trompe sur au moins l'une d'elles, et le préprint ne dit pas quelle différence d'entraînement ou d'architecture produit cette divergence.
| Famille de modèle | Ce que rapporte le préprint |
|---|---|
| Qwen | La direction de requête conditionnée par paire se renforce avant que des interventions sur elle modifient des connaissances ajustées ultérieures ; une comparaison appariée montre qu'elle conserve un effet tardif |
| Gemma | Profil de routage-contenu en couches intermédiaires partiellement chevauchant |
| Llama | Aucune fenêtre d'effet de routage soutenue sous les mêmes critères |
Qwen y arrive par une voie différente. Ses éléments de preuve dans le résumé proviennent d'une réanalyse diagnostique d'états de questions naturelles gelés, et Qwen porte la distinction la plus nette de l'article.
Le transfert : les informations de requête s'estompent, le contenu demeure
Dans le protocole apparié, la dépendance à la direction de requête globale diminue à mesure que l'analyse passe d'ensembles de couches antérieures fixes à des ensembles plus tardifs, tandis que la dépendance au contenu ajusté persiste. Le routage s'affaiblit avec la profondeur ; le matériau derrière la réponse ne s'affaiblit pas.
La réanalyse de Qwen donne une forme à ce basculement. La direction de requête conditionnée par paire devient plus forte avant que des interventions sur elle commencent à modifier des connaissances ajustées ultérieures, et la fenêtre causale s'ouvre pendant que le contenu qui étaye la réponse est encore en formation. Pouvoir lire une direction à une couche et pouvoir modifier le modèle par son intermédiaire ne sont pas la même propriété, et les deux se séparent à des profondeurs différentes.
La limite que les auteurs tracent autour de leur propre résultat
La comparaison appariée de Qwen empêche la conclusion d'aller trop loin : la direction conditionnée par paire conserve un effet tardif. Le transfert opérationnel concerne donc spécifiquement la direction globale ajustée, et non les informations de requête dans leur ensemble. Le pilotage d'un modèle au moyen d'un indice de pays et le pilotage au moyen d'un indice de question appariée se comportent différemment aux mêmes profondeurs.
Le résumé ne quantifie rien de tout cela. Il ne rapporte ni tailles d'effet, ni nombre de couches, ni comparaison de l'effet tardif conditionné par paire avec l'effet antérieur. Cette lacune laisse ouverte la question de savoir quelle part du transfert est un signal fort et quelle part est une direction qui cesse simplement d'avoir de l'importance.
Pourquoi quatre mesures valent mieux qu'une
L'affirmation méthodologique de l'article est que quatre propriétés souvent rapportées ensemble devraient être gardées distinctes : la lisibilité précoce, la force naturelle, le pilotage causal et la dépendance ultérieure au contenu. Une direction peut être lisible dans un état caché sans être ce qui déplace la sortie, et une direction peut piloter une sortie à un ensemble de couches tandis qu'autre chose porte la réponse à un autre.
C'est cette séparation qui permet même de comparer les résultats de Llama et Gemma à celui de Qwen, et c'est aussi là que se situent les limites du préprint. Le protocole n'étant disponible que sous forme de résumé, son affirmation la plus transposable est négative : une direction qui se lit clairement à une couche n'est pas automatiquement celle qui décide de la réponse à cette couche.
- Source : Qwen, Llama and Gemma split on when a model stops routing and starts answering — 2026-09-10
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.