LLM 可解释性:arXiv 预印本,2026年9月10日
Qwen、Llama 和 Gemma 在模型何时停止路由、开始作答上存在分歧
这篇预印本《From Parameters to Answers》将模型早期能够读取的内容与真正驱动其输出的内容区分开来。在 Qwen、Llama 和 Gemma 之间,轨迹各不相同,而有一个请求方向保留了晚期效应,这是简单的“早期对晚期”叙事无法解释的。

预印本实际做了什么
问题是机械性的:当语言模型作答时,它对查询路由信息的依赖,相对于它对支撑答案的知识的依赖,会如何变化?《From Parameters to Answers》于2026年9月10日提交至arXiv,其方法不是读取模型输出并从中倒推,而是对问题末尾的隐藏状态逐层进行干预。
团队将国家-大洲问题与名词、形容词和代码答案进行比较,并保持若干拟合测量彼此区分。两个请求方向获得了名称。成对条件请求方向描述的是,在自然的单国家问题中查询的是哪个国家。全局请求方向描述的是,成对问题中的第一国与第二国请求。独立的选择候选测试对隐藏状态中已有内容的控制。
这三个模型仅以模型家族的形式出现。材料仅提到 Qwen、Llama 和 Gemma,未提及变体、规模或检查点,因此不应将任何内容解读为关于特定发布版本的论断。
Qwen、Llama 和 Gemma 不会按同一时间表切换
配对的三模型轨迹并不一致,这是论文中最值得带出的第一个结果。Gemma 显示出部分重叠的中层路由-内容特征剖面,摘要报告了这一点,但未进一步细分。在相同门控下,Llama 没有持续的路由效应窗口。
这是性质上的分化,而非程度上的差异。任何假设这三个家族在路由与内容上共享同一逐层时间表的人,至少对其中一个的判断是错误的;而预印本并未说明是哪种训练或架构差异造成了这种分歧。
| 模型家族 | 预印本报告的内容 |
|---|---|
| Qwen | 成对条件请求方向在对其干预开始改变后期拟合知识之前增强;一项匹配比较显示它保留了晚期效应 |
| Gemma | 部分重叠的中层路由-内容特征剖面 |
| Llama | 在相同门控下没有持续的路由效应窗口 |
Qwen 通过不同路径得出。其在摘要中的证据来自对冻结的自然问题状态的诊断性再分析,并承载了论文中最鲜明的区分。
交接:请求信息消退,内容留存
在成对协议中,随着分析从固定的较早层组移向较晚层组,对全局请求方向的依赖降低,而对拟合内容的依赖持续存在。路由随深度减弱;答案背后的材料则不会。
Qwen 的再分析赋予这一转变以形状。成对条件请求方向在对其干预开始改变后期拟合知识之前变得更强,因果窗口在支撑答案的内容仍在形成时开启。能够在某一层读取一个方向,与能够通过它改变模型,并不是同一属性,二者在不同深度上分离开来。
作者为自己的结果划定的边界
匹配的 Qwen 比较使该发现不至于过度延伸:成对条件方向保留了晚期效应。因此,操作性交接具体涉及全局拟合方向,而非整体的请求信息。通过国家线索引导模型与通过成对问题线索引导模型,在相同深度上表现不同。
摘要没有量化其中任何内容。它没有报告效应量、层数,也没有将晚期成对条件效应与早期效应进行比较。这一空白使以下问题悬而未决:这一交接中有多少是强信号,又有多少只是一个不再重要的方向。
为什么四种测量胜过一种
论文的方法论主张是,四种常被一起报告的性质应当被分开:早期可读性、自然强度、因果操控和后期内容依赖。一个方向可以在隐藏状态中清晰可辨,却并不是推动输出的东西;一个方向可以在一组层上操控输出,而另一处则由其他东西承载答案。
正是这种分离使 Llama 和 Gemma 的结果能够与 Qwen 的结果相比较,这也是预印本局限所在。由于协议仅以摘要形式提供,其最具可迁移性的主张是一个否定性主张:在某一层读取清晰的方向,并不自动就是在该层决定答案的方向。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。