SevenTnewS

AI可解释性

神经网络的决策现在可以追溯到具体的训练样本

研究人员展示,利用Gram几何,神经网络行动分数可以表示为训练样本回报的精确加权和。这使得训练后审计信号能够识别有影响力的案例、衡量行动一致性并标记支持薄弱的情况,而无需重新训练或访问原始优化轨迹。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-03 · 阅读需 5 分钟

神经网络的决策现在可以追溯到具体的训练样本
来源 : From Neural Net…

现代神经网络在医疗诊断、信贷审批和能源竞价等高风险的决策中发挥着指导作用。但是,当模型给一个行动打出高于另一个行动的分数时,其推理过程仍然不透明:训练经验被吸收到学习参数中,而不是作为可检查的案例记忆暴露出来。华中科技大学的一篇预印本现在提供了神经网络行动分数与塑造它们的训练案例之间的精确代数桥梁。

在《从神经网络决策到训练案例:基于案例决策理论的精确解释》中,研究人员Manli Yan、Yuebin Lin、Yaowen Yu和Yong Zhao证明,对于固定表征的普通最小二乘(OLS)读取器,每个行动分数恰好是训练样本回报的加权和。权重来自表征的经验Gram几何,这是一种纯代数关系,使案例层面的证据变得明确。

精确的基于案例的分解

关键见解建立在基于案例的决策理论(CBDT)之上,该理论将决策建模为汇总来自记忆案例的结果支持。CBDT形式化了一种熟悉的人类模式:我们通过将当前问题与过去经验进行比较,并总结相似案例的结果来评估当前行动。

作者们证明,一个固定的神经网络表征,配备一个OLS顶层探针,会产生具有相同结构形式的行动分数。对于一个测试输入和候选行动,分数等于训练案例的系数乘以该行动的回报之和。该系数由表征的内积几何决定:αi(x) = φ(x)G−1φ(xi),其中G是经验Gram矩阵。

当表征矩阵具有满列秩时,这个分解是精确的,并且在病态情况下可以采用吉洪诺夫正则化版本。这个系数向量是一个一致线性系统的唯一最小范数解,因此是规范化的而非任意的。

语义:相似性还是有符号的影响力?

代数形式与CBDT的聚合结构相匹配,但语义在一个关键方面有所不同。CBDT使用非负的相似性权重,这一约束反映了人类如何检索和权衡过去的经验。相比之下,OLS导出的系数是有符号的、未归一化的,并且源自Gram几何而非相似性。

作者们确定了一个充分的区间,在此区间内系数可以简化为缩放的内积并与CBDT相似性语义匹配:当表征被白化使得G = n IH时。在这个区间之外(实践中很少见),系数最好被解释为有符号的Gram-几何影响项,而不是相似性权重。正系数对应于提升行动分数的邻近案例;负系数则作为抵消它的远场校正。

这一区别防止用户将影响力与相似性混为一谈,并阐明了检索到的案例的实际含义。

无需重新训练即可进行审计

该分解为训练后检查提供了三个实用的审计信号:

  • 案例审计分数:对于每个测试点和候选行动,每个训练案例的有符号贡献ψi(a, x) = αi(x) ri,a追溯了哪些案例提高、降低或抵消了分数。按绝对贡献排序可揭示最有影响力的案例。
  • 行动一致性影响的熵:通过对前k个最有影响力的案例的最优行动构建概率分布,并按绝对影响质量加权,该方法产生一个熵度量。低熵意味着有影响力的案例指向单一行动;高熵则揭示了分散或冲突的证据。
  • 案例影响风险诊断:将影响熵与前10个最有影响力的案例之间的基尼分歧项结合,产生一个风险分数,用于标记支持薄弱的预测,即最强训练案例影响提供冲突行动证据的情况。

所有三个信号只需要在固定表征上拟合一个OLS顶层探针。无需重新训练表征,无需访问优化轨迹,也无需了解原始损失函数。

实验验证

实验涵盖了具有已知地面真相的合成CBDT生成器、具有真实负荷观测值的PJM能源竞价,以及两个UCI代理决策任务(成人收入和默认信贷)。在五个随机种子下,该方法在合成数据上达到了96%的CBDT最优行动一致性,并在真实任务上实现了强大的分数重建相关性(PJM行动的0.9998、0.9972和0.9592)。

在与影响函数、代表点选择、TracIn和内积基线的归因比较中,所提出的系数在Top-30行动一致性上达到最高(0.941 ± 0.030),同时在与地面真相案例贡献的皮尔逊相关性上保持竞争力(0.368 ± 0.172)。

审计成本在缓存实现中平均为每次查询58.6毫秒,高于亚毫秒级的基线,但在训练后审计场景中是可以接受的,因为决策相关的案例检索是优先事项。

边界与未来工作

作者们对该框架的局限性持明确态度。该解释仅对固定表征的OLS读取器是精确的;端到端的非线性头不在覆盖范围内。实协变量实验使用了合成或代理行动回报,而大规模训练记忆可能需要Nyström近似。将分析扩展到非线性探针和估计的反事实回报仍然待解。

尽管存在这些边界,这项工作通过明确的基于案例的证据,为神经决策提供了一个实用的训练后审计视角。当一个模型对贷款申请、诊断或能源竞价进行评分时,该框架现在可以回答:哪些训练案例驱动了那个分数,它们带来了什么结果,以及它们的支持有多一致。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。