2 published articles
强化学习
体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。
2026-07-30
AI研究
多任务强化学习有一个难以启齿的秘密:驱动对齐的奖励信号常常相互冲突。一个国际团队刚刚发表了一种方法,可以防止系统自我对抗,而且将其添加到现有管线中几乎不增加成本。
2026-07-19