SevenTnewS

AI研究

新审计发现:分布式强化学习头的风险判断大多不成立

大规模审计显示,分布式RL智能体在从业者最可能信任的状态点上系统性地编造了风险权衡。在基于QR-DQN、C51和IQN的MinAtar环境中,最强断言无一可被证实,而依据智能体的CVaR建议行动有时表现显著低于随机水平。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-29 · 阅读需 5 分钟

新审计发现:分布式强化学习头的风险判断大多不成立
来源 : Auditing the Ri…

分布式强化学习已成为现代AI的主导范式。通过将单一的期望回报替换为未来奖励的完整概率分布,这些方法为一些最著名的游戏智能体成果提供了动力,并奠定了日益增长的教科书理论。但来自研究员Hari Prasad的一项严谨新研究提出了一个很少被直接衡量的问题:当训练完成的分布式智能体报告两个动作在风险上存在差异时,该报告是否真实?

在七种不同的算法与游戏组合以及数千个审计状态中,答案通常是“不”。该论文作为预印本发布,并附带完整的审计工具包,提供了作者所称的“在采取任何纠正措施之前必须进行的诊断”,针对的是多年来被怀疑但从未在决策层面量化的缺陷。

审计指标:隔离关键因素

Prasad的核心技术贡献是一种名为超额Wasserstein差距的审计指标,记作Δx(s)。对于智能体在给定状态下按均值排名最高的两个动作,该指标衡量其回报分布之间的Wasserstein-1距离减去均值之差的绝对值。当Δx(s)为零时,一个动作一阶随机占优于另一个,所有单调风险泛函对它们的排序相同,且风险敏感策略不会偏离均值贪婪策略。当Δx(s)为正时,智能体声称存在真正的风险权衡:两个动作在每一个分位数上并不都是同样安全的,用户可能会根据尾部厌恶理性地做出选择。

Prasad写道:“该指标精确地隔离了那些具有决策内容的断言。它忽略了两者共享的误差, , 审计的是相对风险断言,即实际行动所依据的那类。”这种筛选与统计检验框架配合使用,包括置换零假设、自助法反证检验和错误发现率(FDR)控制。论文指出,如果没有该框架,审计本身也可能制造出错误的结论,并记录和量化了基于重启的评估中的两个潜在陷阱。

三种算法呈现出相同特征

Prasad在三个MinAtar游戏(Breakout、Seaquest和Asterix)上训练了QR-DQN、C51和IQN智能体,每种算法使用多个随机种子,共进行33次运行。结果惊人地一致:

  • 66%至95%的最强声称权衡(每个智能体自身Δx(s)排名前2%的状态)在95%置信水平下被驳斥。
  • 几乎没有任何断言可被确认:在三个游戏中,QR-DQN所有735个状态的测试经FDR校正后,无一通过。
  • 学习到的超额值与真实超额值之间的相关性在所有种子和游戏中均接近零(Pearson r ≈ 0.0)。
  • 智能体最自信断言的分布位置,在统计上与不考虑真实情况的随机洗牌无异。

Prasad总结道:“这些头模在最强断言的定位上并不优于随机猜测。”这个问题并非训练不足的表现:它在训练50万步后完全形成,随着从业者可能依赖的断言强度而增长,与最终得分无关,并且在预训练的接近最优的Atari智能体上也能复现。

决策层面的后果:从有益到反预测

为了检验理论上的驳斥是否转化为实际损害,Prasad比较了在智能体标记为最风险关键的三种状态下选择更安全动作的决策者:头模自身的CVaR排序、忽略风险的均值贪婪基线,以及真实情况。结果是依赖环境的,从业者无法依据任何可靠规则。

在Breakout中,QR-DQN头模确实提供了信息:81%的时间选择了更安全的动作,而均值贪婪基线为44%,遗憾值从1.36降至0.20。但在Seaquest中,头模是反预测的:仅34%的时间选对了真正更安全的动作(低于随机水平,p = 0.045),遗憾值大约是完全忽略风险时的三倍。在Asterix中,它就像抛硬币一样。

Prasad写道:“从业者无法判断处于哪种情况。有时有用、有时相反的指导,比完全无信息的指导更难使用。”C51的表现更差,在全部三个游戏中都被均值贪婪基线击败。

修复措施未能恢复可用的风险断言

论文测试了文献中提出的三类修复方法。在训练过程中让智能体基于CVaR贪婪(优化尾部)进行学习,未能改变过度断言的问题。一个五人集成模型减弱了最强断言,但未校准它们。通过等渗映射进行重新校准虽然完美挽救了对阳性对照的验证,却只能通过对最强断言进行归零处理来通过审计, , 即声称不存在任何真实权衡。

Prasad写道:“头模并非未校准,而是无信息。缺失的是信息,而非可修正的尺度误差。”一项蒸馏对照实验确认,当直接使用真实目标进行监督时,该架构能够拟合真实分布,从而将缺陷归因于自举训练过程,而非网络容量。

两个可能误导研究者的陷阱

论文记录了作者在开发审计过程中遇到的基于重启评估中的两个方法论陷阱。第一个是RNG克隆,当深度复制环境时,其内部随机生成器也被克隆,导致每一个“随机”展开都重放相同的未来。这种失败是隐蔽的,方向合理,且容易通过代码审查。第二个是经验Wasserstein噪声基底,即使两个样本来自同一分布,也会产生正的经验超额值,且该值随n−1/2衰减。一个简单的固定阈值可能“确认”三分之二实为纯噪声的断言。

在最终设计之前,这两个陷阱都曾产生过令人信服但错误的审计结果。Prasad警告说:“对分布式RL断言的验证必须在实际样本量下,针对每个状态的零假设进行校准。”

该发现对领域意味着什么

分布式RL头模越来越多地用于三个实际目的:通过可视化回报分布来解释智能体行为、通过CVaR等泛函设定阈值以生成风险敏感策略,以及在自动驾驶和安全RL流程中作为安全信号进行监测。这三个用途都基于一个假设:当学习到的某个动作的分布形状与另一个不同时,环境确实包含该风险结构。

Prasad总结道:“直接解读分布式头模输出在最有可能被参考的状态点上最不可靠,在信任它们之前,应首先对照真实情况进行验证。”对于在原始分布式头模基础上构建不确定性估计器、集成模型和校准层的日益增长的研究工作,该审计既提供了一个测量基准,也给出了一条令人清醒的基线:一个无信息的头模无法为事后修正提供可用的信号。论文发布了其完整的审计工具包,并为未来方法设定了具体标准:通过审计的头模应能确认其最强断言。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。