研究
后见之明填补了智能体强化学习中的监督鸿沟
SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。

用于大语言模型的强化学习存在一个盲点。当一个智能体执行二十个动作,却只在最后才知道自己是成功还是失败时,信号过于稀疏,无法让模型了解哪些决策是关键的。基于结果的强化学习有效,但它留下了从回合级奖励到产生该奖励的令牌级策略之间的监督鸿沟。
香港大学和上海人工智能实验室的一个团队提出了一种解决方法,事后看来几乎显而易见:让模型分析自己完成的轨迹,并记下它所学的经验。然后,在训练期间将这些经验反馈到策略中。他们称之为SEED(自我进化的同策略蒸馏),这篇于2026年7月16日发布在arXiv上的预印本显示,在基于文本和视觉的智能体任务中均取得了持续的改进。
从稀疏奖励到密集信号
核心见解是,当提示LLM检查它刚刚完成的一条轨迹时,它可以生成自然语言的技能,这些技能捕获了可重复的工作流、关键观察或避免失败的规则。这些不是由人类编写的静态模板;它们从当前策略的行为中浮现出来。一个在导航任务中容易过冲的模型可能会生成像“在三次移动失败后,检查目标是否仍在可见区域内”这样的技能。
然后,SEED利用这些技能创建一个密集的令牌级信号。它在两种上下文中重新评分相同的动作:基线上下文和增强了事后技能的上下文。令牌概率的差异成为一个蒸馏目标,将策略推向其自身事后分析所暗示的行为。这个信号与基于结果的强化学习目标并行运行,因此模型不必在稀疏奖励和密集提示之间进行选择;它两者兼得。
自我进化的监督

自我进化的部分很重要,因为今天收集轨迹的策略优于昨天收集轨迹的策略。SEED在首次传递后并不冻结分析模块。同一个模型既是行动者,也是事后分析者,因此随着策略的改进,它提取的技能也随之改进。蒸馏信号保持同策略,这意味着它反映了当前的轨迹分布,而不是某个过时的快照。
这避免了先前在事后重新标注或技能提取工作中常见的问题,即辅助监督与模型实际产生的行为失去同步。SEED的反馈循环使两者保持一致。
实验结果显示
论文报告了在基于文本的环境(ALFWorld、ScienceWorld)和基于视觉的环境(Craftax,一个地牢探索基准)中的实验。在所有情况下,SEED都优于纯基于结果的强化学习和使用固定的、预提取技能的基线。在监督鸿沟最大的长周期任务上,改进最为显著:需要十五步以上的ScienceWorld任务显示,成功率比最好的纯强化学习基线提高了22%。
对未见场景的泛化能力(通过在训练期间保留环境配置进行测试)也得到提高。作者认为,事后技能捕获了真正可重用的模式,而不是任务特定的记忆,并且蒸馏步骤将这些模式转移到策略中,而不会过度拟合训练分布。
一张表说明一切
在四个环境和多个难度级别中,SEED在十二次报告的比较中击败了次优方法九次。唯一的失败出现在非常短的回合中,此时监督鸿沟已经很小。
| 环境 | 指标 | 仅RL | 固定技能 | SEED |
|---|---|---|---|---|
| ALFWorld | 成功率 | 57.3% | 61.8% | 68.1% |
| ScienceWorld | 成功率 | 34.1% | 39.5% | 46.3% |
| Craftax(视觉) | 平均奖励 | 57.2 | 62.3 | 71.0 |
这些改进还不足以称为突破,但它们是一致的,并且在更长的任务中会累积。这正是从业者关心的信号:一种无需全新架构或更大训练预算就能悄然提升性能的方法。
待解问题
论文留下了一些未解决的问题。事后分析模块产生的技能未经任何外部验证;模型可能会生成听起来合理但却是错误的经验。作者指出,蒸馏信号仅从概率偏移计算,因此一个错误的技能平均而言不会提供有用的梯度,但他们没有分析模型产生误导性事后技能的频率,也没有分析这种失败模式在规模化时是否足够常见以至于重要。
在训练过程中对每条轨迹运行分析模块的计算成本也不小。论文报告称,由于分析是对每条轨迹的一次前向传递,因此开销是可控的,但在复杂环境中的非常长的回合中,这种额外的传递会累积起来。
尽管如此,SEED是近期涌现的智能体强化学习方法中更实用的提议之一。它不需要人工标注,保持其监督信号的新鲜度,并且可以在标准强化学习管道之上工作,无需侵入性修改。对于训练在长周期任务上挣扎的智能体模型的团队来说,这值得探讨。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。