机械可解释性
gemma-4 实际掌握的物理知识:新论文发现其表征是真实的
关于 gemma-4-E4B-it 的新研究揭示,该模型内部对材料科学机制的表征与其给出的答案存在因果关系。该研究结合了多种探针和干预技术,表明物理知识编码在状态变换中,而不仅仅是静态模式中。

大型语言模型能够回答科学问题,但至今很难判断它们究竟是真正理解了物理原理,还是仅仅在模仿表面模式。一篇于2026年7月22日发表在arXiv上的预印本,使用开源模型 google/gemma-4-E4B-it,通过一系列探针和干预技术直击这一问题,旨在揭示材料科学机制是否以可读取、具有因果作用的表征形式存在。
三种表征形式
论文指出,机械信息在模型内部呈现三种可通过实验区分的形式:概念可从单个隐藏状态中读取;构成取向通过状态间的受控变换来承载;选定的内部表征因果性地控制工程学答案。研究人员结合了匹配的直接词汇读出和雅可比词汇读出、无需选项的状态几何、一个包含60条定律的反事实基准测试以及因果干预,分别验证了这三种形式。
在50个保留的材料描述中,三个独立拟合的雅可比透镜重现了概念排序,而来自两种读出的无目标单词集合实现了对10个机制家族中9个的盲识别。第10个家族未被识别,作者将其归因于该家族更多由词汇相似性而非独特的物理概念来定义。
图谱审计与方向测试

一个独立的72提示基准测试产生了与机制相关的隐藏状态邻域,但精确的图谱审计显示,这种表面上的物理组织同样可以用数值比较来解释。这是一个警示性结果:状态空间结构看起来可能像是编码了物理原理,而实际上可能仅仅是算术运算。
为解决这一问题,研究团队比较了仅物理输入方向相反的相同提示,观察由此产生的隐藏状态移动是否遵循所提供的构成定律。这些状态变换正确地为40条方向性定律中的39条确定了方向,而词汇对照组的正确率接近随机。在60个冻结关系上,直接、物理中性和逆定律的顺序也被正确排列。结论是:相较于仅观察绝对状态,物理关系在受控状态变化中更易显现。
因果干预与反事实测试
双向干预在所有12个匹配案例中,将使答案概率向物理上正确或错误的结果偏移。反事实状态修补在不同机制和答案格式间传递了相反的决策信号。这是一种超越相关性的因果证据:当表征的方向改变时,答案也随之改变。
这项工作的意义超出了材料科学范畴。它提出了一种通用方法论,用于测试模型的物理知识是真实的还是肤浅的,其方法是通过受控方向反转和定向干预,而非仅依赖静态探针。强调运动而非位置是该方法论的创新之处。
对可解释性的意义
可解释性研究长期以来一直在纠结一个问题:大语言模型是否包含真正的科学理解,还是仅仅擅长模式匹配。这篇论文的结论倾向于“足以进行引导的真实理解”。这些表征并非被动存在,它们具有因果活性且方向一致。
gemma-4-E4B-it 的开源特性使得这项实验成为可能。专有模型很少允许研究人员以这种粒度探针和修补单个隐藏状态。这是开源生态系统的结构性优势:这类论文在闭源模型上更难以完成。
然而,图谱审计的结果中有一个令人警醒的注脚。状态空间邻域可能具有欺骗性。模型可以以一种看似反映物理原理的方式组织其表征,却并未真正利用这种组织来进行推理。方向测试在表象之下发现了真正的物理结构,但并非所有表面结构都能经得起审视。
作者建议,下一步是将该方法扩展到其他科学领域,以及不同规模的开源模型,以观察相同的表征模式是否在不同规模上成立。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。