SevenTnewS

可解释性

高重建分数不代表你的AI解释是真实的

自然语言自动编码器通过重建来评分解释,但一项新研究表明,即使98%的具体声明是虚假的,该测试仍能通过。作者引入RECAP训练方法,让探针能够独立验证指定内容,在对抗性谎言检测中达到了AUC 0.95,而标准方法仅为随机水平0.51。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-24 · 阅读需 4 分钟

高重建分数不代表你的AI解释是真实的

可解释性研究者依赖一个简单的假设:如果你能从一段人类可读的解释中重建一个神经元的激活,那么该解释必定捕捉到了某种真实的东西。一篇于2026年7月22日发布在arXiv上的论文,训练模型而非读者:用于可验证激活解释的可解码性监督,认为这一假设在结构上是不成立的。

自然语言自动编码器的工作原理是训练一个编码器,将隐藏激活转换为词语,并训练一个解码器从这些词语中重建激活。高重建意味着解释通过了测试。作者指出,问题在于测试以两种方式通过,而只有一种是忠实的。

概要并非真相

当由Hiskias Dingeto Dr领导的团队对已发布的Qwen-2.5-7B语言化器运行标准流程时,解释的重建结果远高于随机水平。但这些解释中,只有约2%的个别事实声明实际上依赖于重建,这意味着你可以翻转98%的声明,而重建结果几乎不变。分数追踪的是概要,而非具体事实。

这一发现呼应了可解释性领域已知的紧张关系:高层语义内容(“这个神经元检测到主谓一致”)和低层重建保真度可能分歧。此前Anthropic等人的研究已表明,激活解释可能看似合理,但与模型实际计算内容无因果关系。新论文将这一失败模式在自动编码器设置中形式化,并表明它并非个例。

每次运行中的共适应编码

示意图:标准语言化器与RECAP管道对比

作者设计了一个合成真实基准设置,其中一组激活的正确解释已知。运行标准训练流程产生的解释获得了高重建分数,但5次独立运行中全部收敛于共适应的私有编码:解码器依赖于这些措辞,但它们并不对应模型的实际行为。这些编码看起来像正常的英语,但实际上是编码器和解码器之间的秘密信号,完全绕过了目标模型。

固定目标模型的参数(这是稳定可解释性的一种常见建议)并无帮助。编码器-解码器对只是调整其私有信号,以保持在冻结目标模型的输出流形内。这表明,失败并非训练假象,而是当前重建游戏的结构性属性。

RECAP:一种替代方法

论文并未尝试修补重建测试,而是提出了一种不同策略。RECAP(通过联合训练辅助预测器的可读编码)在目标模型旁边训练线性分类器头,使指定的内部内容可独立解码。在RECAP准备好的模型上训练的新语言化器能真实陈述指定内容,共适应编码也随之消失。作者报告了模型困惑度仅增加了+0.001 nats。

在合成真实基准训练的沙盒上,RECAP训练的语言化器达到了与已知真实基准相当的真实性分数。结果在预训练的Pythia-160M上得到复现:指定内容变得可靠地可通过探针解码。一个新的语言化器仅部分传达了指定内容(真实性分数0.44、0.46,而非RECAP版本接近零的控制值),表明该方法在大规模上并非完全解决方案,但是一种有意义的改进。

对抗性鲁棒性

最强的结果来自对抗性设置。作者构建了一个对手,通过编辑语言化器的解释来最大化重建分数,同时插入谎言,有效压制了约87%的虚假声明惩罚。标准探针的检测AUC降至0.51,统计学上为随机水平。但RECAP训练的探针保持了0.95的AUC,准确标记出被压制的谎言。

这些数字令人瞩目:在相同模型、相同编辑和相同对手下,AUC 0.95 vs 0.51。控制探针无法判断语言化器是否在撒谎,而RECAP探针能始终如一地识破谎言。

对安全性和可解释性的影响

对于可解释性社区,论文的主要信息是警示性的:高重建分数并不能认证个别声明。研究者对安全关键模型运行语言化器时,不能仅仅因为重建效果看起来不错就信任解释。对于AI安全性而言,影响则有所不同。RECAP使得指定内部内容能够通过探针独立检查,而不是依赖模型可能操纵的文字。一个独立探针对语言化器的真实声明评分高于虚假声明,AUC达到0.96,而未使用RECAP时仅为0.82。

该方法并非即插即用:在目标模型旁边训练线性头需要修改训练流程,并且Pythia的复现显示,新的语言化器只能捕捉约一半的真实内容。但方向是明确的:与其试图修补重建测试,不如构建一个系统,其中指定事实通过一个语言化器无法欺骗的独立通道进行解码。

论文已在arXiv上发布(2026年7月22日提交),同时附有代码和数据仓库。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。