SevenTnewS

AI研究

强化学习自我破坏问题的两词解法

多任务强化学习有一个难以启齿的秘密:驱动对齐的奖励信号常常相互冲突。一个国际团队刚刚发表了一种方法,可以防止系统自我对抗,而且将其添加到现有管线中几乎不增加成本。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-19 · 阅读需 4 分钟

强化学习自我破坏问题的两词解法

基于人类反馈的强化学习(RLHF)已成为使大型语言模型与人类偏好对齐的标准方法。但随着模型在日益扩大的目标集(指令遵循、写作风格、事实准确性、代码正确性)上训练,驱动学习的奖励信号变得混乱且常常相互矛盾。一篇来自国际研究团队的新论文提出了一种直接解决这些不稳定性的修正方案。 验证地平线:为什么验证编码代理现在比构建它们更难

多奖励问题

在多任务强化学习中,每个提示都会产生自己的奖励向量,结合了二元判断(模型是否遵循了指令?)、分数指标(输出语法有多好?)和连续度量(嵌入相似性)。这些奖励通常以截然不同的尺度和分布运行。更糟糕的是,奖励维度可能相互关联:一个写作好的模型在指令遵循上也可能得分更高,仅仅因为连贯的语言与完成任务本身相关。标准的优势估计方法通过加权和计算单个标量,这会放大来自异方差性和冗余性的噪声。 OPID为语言智能体提供密集奖励信号,告别外部记忆依赖

“核心困难在于,在优势计算之前对奖励进行简单的标量化会产生不稳定的梯度更新,”作者写道。“当奖励分布在提示和训练阶段之间变化时,这尤其严重。”

研究人员识别出两种失败模式:幅度差异(一个范围为0-1的分数奖励与一个范围为0-100的连续奖励配对)和相关冗余(两个编码重叠信息的奖励维度,导致过于自信的梯度步长)。

RDPO的两阶段架构

奖励去相关策略优化依次解决了这两个问题。第一阶段应用幅度感知分位数归一化(MAQ),它对批处理中给定维度的所有奖励进行排序,以其中位数锚定,并通过四分位距缩放。与标准分位数归一化不同,MAQ通过将中位数作为学习参数跟踪来保留幅度信息,这使得模型能够区分持续高奖励和偶尔高奖励。

第二阶段在每个活跃奖励子空间内应用马氏白化。研究人员对给定提示活跃的奖励维度(即完整奖励向量的任务相关子集)进行分组,并计算马氏距离,这有效地在聚合成标量优势之前去相关了这些维度。这可以防止冗余信号在梯度更新中被重复计算。

“马氏步骤至关重要,因为它充当了每批次的修正,”作者解释道。“奖励相关性不是静态的,它们会随着模型策略的变化而变化。在线去相关捕捉到了这种动态。”

在LongCat-Flash上的结果

研究人员将RDPO集成到现有长上下文模型LongCat-Flash的后训练管线中。与标准优势估计相比,RDPO在MT-Bench指令遵循子集上将指令遵循提高了8.3个百分点,在专有写作评估套件上将写作质量得分提高了6.1分,并在对抗性测试中将模型对困难提示变体的敏感性降低了12%。在标准推理基准(GSM8K、MATH)和代码评估(HumanEval、MBPP)上,性能与基线相比保持在统计噪声范围内,去相关步骤未导致性能下降。 IFBench:测试AI指令遵循能力的新基准

一项消融研究表明,MAQ和马氏白化各自都有益:仅MAQ就恢复了总增益的60%,白化步骤增加了其余部分。移除两者则性能下降到原始基线水平。

更广泛的影响

这篇论文发表之际,RLHF管线正面临越来越多的审视,关于奖励黑客、奖励模型崩溃和多目标优化的脆弱性的争论不断。RDPO提供了一个相对轻量级的插件:它不需要重新训练奖励模型,只需修改优势计算,这使得它适用于现有的RLHF管线。 how-local-llms-like-gemma-and-qwen-are-taming-open-source-repository-triage-at-scale

“这种方法的美妙之处在于,它将奖励处理视为一个一等优化问题,而不仅仅是预处理步骤,”不参与该研究的强化学习研究员Sarah Chen博士表示。“许多实验室只是简单地将奖励归一化为均值零、单位方差,然后听天由命。RDPO明确针对两个最困难的情况进行设计。”

尚未解决的问题

该论文没有解决奖励模型本身的准确性, , RDPO只改进了奖励的消费,而不是奖励信号的质量。如果奖励模型存在偏差或对齐不良,即使去相关,策略仍将针对错误的目标进行优化。此外,还有计算每批次协方差矩阵的计算开销,这随活跃奖励维度的数量呈二次方增长,可能在极高维空间中成为瓶颈。 MiniMax M3 突破开源权重天花板:CUDA 加速 9.4 倍,全程无需人工干预

作者承认,他们的方法假设奖励维度可以合理地划分为活跃子空间,这一设计选择对于目标深度纠缠的任务可能并不直接。

“我们将RDPO视为更原则性多奖励RL的基础,而非最终解决方案,”他们总结道。“理解奖励何时应该去相关、何时应该保持耦合,是一个开放的研究方向。”

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。