强化学习
微软体验式学习:给AI模型一个教练,而不仅仅是分数
体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。

语言模型的强化学习存在一个瓶颈,任何调试过奖励模型的人都深知这一点:信号太薄弱。一种评分标准评估一个响应,将该评估压缩成单个标量,然后丢弃关于为什么一个响应优于另一个响应的所有其他信息。两个得分相同的响应可能具有截然不同的质量特征,但模型永远无法学习其中的差异。
本周发表arXiv上的一篇微软亚洲研究院论文提出了一种修复方法,将有价值的文本反馈视为主要信号而非浪费。体验式学习用作者所称的体验知识(即由教练模型提取的结构化、可迁移的文本反馈,然后在训练过程中将其蒸馏到策略模型的权重中)取代了标量奖励。
核心见解很简单:如果已经有了一个根据评分标准评估响应的评委模型,那么该评委就拥有它从未传递的丰富信息。作者将其重新定位为一个输出每个响应简短自然语言分析的教练:它做得好在哪里,不足之处在哪里,以及一个更强大的答案会是什么样子。然后,该文本作为生成演示质量响应的教师模型的条件。策略模型通过在线策略上下文蒸馏从这些演示中学习,基本上是在更新自身参数的同时读取教练的反馈和教师改进后的响应。

这不同于我们今年早些时候报道的在线策略技能蒸馏框架,尽管两者都认同更密集的反馈很重要的直觉。OPID从完成的轨迹中提取事后监督;EL从评委自身的评估文本中提取。两者可能是互补的。
该论文在两种策略族上测试了EL:开源Llama-3.1-8B-Instruct和一个专有模型,使用策略自身或GPT-4o作为教练的反馈。在保留的和未见过的开放式任务(评分标准存在但答案空间很大的类型)上,EL始终优于标准的基于评分标准的强化学习。
最有趣的结果是在训练分布之外的情况。基于评分标准的强化学习倾向于过拟合其训练的评估标准;在测试时给定略有不同的评分标准,性能会下降。EL的模型表现更好,表明文本反馈教会了更普遍的质量理解,而不是从评分标准到分数的机械映射。作者还报告说,EL减轻了奖励欺骗,即模型学会利用奖励函数中的漏洞而非真正解决问题的现象。
这一点很重要,因为奖励欺骗是基于强化学习的对齐中一个持久的问题。我们最近报道的强化学习自我破坏问题的两字修复从一个不同的角度解决了这个问题,防止优化过程自我对抗。EL从数据方面解决它:如果奖励信号携带更多信息,模型发现脆弱捷径的空间就更小。
这种权衡在于计算成本。对每个在线策略响应运行教练模型和教师模型会增加训练成本。该论文没有报告挂钟时间比较,但该流程显然比标准强化学习循环每训练步骤需要更多的前向传递。问题在于泛化性和稳健性的提升是否值得额外的花费,而对于任何针对非可验证任务(写作、推理、开放式对话)进行训练的团队来说,到目前为止答案是肯定的。
代码承诺在微软的仓库中以项目名称EL提供。一旦发布,真正的考验将是该方法能否扩展到更大的模型,并在不同的教练模型下保持稳定。目前,它提供了一条具体路径,以摆脱自RLHF成为标准以来一直限制开放式任务后训练的标量陷阱。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。