SevenTnewS

深度研究AI

BAAI的新研究智能体不只是搜索更长时间,它还会检查自己的作业

BAAI的AREX智能体使用递归自我改进循环,压缩长研究历史,实现高效的验证驱动型精炼。通过一种新颖的长视野强化学习方法进行训练,它们在BrowseComp、DeepSearchQA和HLE上优于可比基线。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 阅读需 3 分钟

BAAI的新研究智能体不只是搜索更长时间,它还会检查自己的作业

深度研究存在一个大多数智能体忽视的不对称性:找到正确答案成本高昂,但验证候选答案却很便宜。北京人工智能研究院(BAAI)构建了一个利用这一差距的智能体系列。AREX,即递归自我改进的深度研究智能体,不只是搜索更长时间;它通过将自身的中间输出视为值得再次审视的半成品来进行更智能的搜索。

架构:一个审视自身循环的循环

AREX将研究过程分成两个嵌套循环。内循环收集证据并组装一个临时答案。然后外循环审核该答案,检查原始问题施加的每一个约束。当发现未解决的声明或薄弱环节时,它会发起针对性的后续研究,不是又一次广泛搜索,而是有针对性地回到具体缺口。

如何在长时间跨度内维持这一点而不丢失已验证信息的踪迹是困难的部分。AREX通过一个学习到的自主上下文更新工具来解决,该工具将不断增长的交互相压缩成一个紧凑的改进状态。关键在于,这种压缩不依赖外部模型,智能体学会管理自身的增长。改进状态保留了已验证的证据和未解决的约束,使外循环在每次研究迭代后都能精确地从上次停下的地方继续。

为耐力而非仅准确性训练

BAAI使用两阶段方法在验证过的合成任务和高品质轨迹上训练AREX。首先,智能体中期训练教会模型在多轮研究环境中航行。然后,长视野强化学习塑造智能体在多个步骤中持续改进。

具有稀疏最终奖励的强化学习对于长序列来说出了名的困难。AREX通过强调关键步骤来缓解这一问题,这些步骤是获得决定性证据或智能体纠正错误研究方向的时候。这种奖励塑造为模型提供了更密集的训练信号,无需外部评判者,在精神上类似于最近关于用于智能体强化学习的策略技能蒸馏的工作。

以小博大

AREX有两种规模:一个密集的4B参数模型和一个122B参数的专家混合版本,每个token仅激活10B参数。论文报告称,在BrowseComp、WideSearch、DeepSearchQA和Humanity's Last Exam(HLE)上,AREX显著优于可比规模基线,并且与使用显著更多激活参数的模型保持竞争力。尤其是4B模型,它让人们一窥高效架构和智能训练在没有专有实验室庞大计算预算的情况下能实现什么。

这对深度研究竞赛意味着什么

AREX正值东亚开源势头加速之际问世。BAAI与DeepSeek、百川等一起证明了无需专有基础设施也能构建前沿能力的研究智能体。递归自我改进循环结合学习到的上下文压缩,为其他实验室提供了一个可采用的蓝图,论文的代码和模型权重可在项目页面和Hugging Face上获取。

更广泛的信号是,开放与封闭AI之间的差距正在缩小,不是因为专有模型停滞不前,而是因为研究智能体正在学会从更少中获取更多。AREX的4B模型挑战了深度研究需要500B参数大脑的假设。如果验证引导的精炼成为一种标准模式,下一代研究智能体可能更少由其规模定义,而更多由其自我审视的能力定义。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。