长程推理
新框架帮助AI代理记住五分钟前的操作
PRO-LONG是一个极简框架,帮助LLM代理在长序列操作中保留和检索信息。在ARC-AGI-3基准测试中,它在多个前沿模型上平均提升通过率18个百分点,同时消耗的token比现有框架少4.2到5.8倍。借助Fable 5,它以1,750美元的总推理成本实现了97.4%的best@2得分。

构建AI代理的标准方法是给它一个提示、一套工具集以及一份当前所有操作的运行记录。这份记录随着每一步而增长,最终模型要么忘记了早期读取的内容,要么浪费token重新读取整个记录。这是ARC-AGI-3基准测试毫不留情地暴露出的问题:在独立谜题中表现出色的模型,一旦谜题在几十个步骤中串联起来,就会崩溃。
上下文之墙
现有的代理框架通过压缩或修剪历史记录来应对这一问题。总结较早的回合。删除那些看似无关的回合。问题是,在第12步看起来无用的细节在第47步可能至关重要,而一旦它被删除,代理就无法恢复。这种权衡是固有的:保留更多上下文,检索成本高昂;保留更少,代理则盲目工作。
2026年7月arXiv预印本中提出的PRO-LONG采用了一种不同的方法。它不会决定保留什么,而是保留一切,但将日志结构化为可搜索的交互记录,并依赖代码生成模型以编程方式查询它。其思路是,近期代码代理(通过编写和执行代码来解决问题的模型)的改进使得搜索步骤足够廉价,以至于完全不需要修剪历史。
工作原理

该框架并不改变底层LLM。它为其添加了两个组件:一个结构化记录器,将每次观察和操作写入类似JSON的版本化存储中;以及一个检索模块,当代理需要参考过去的上下文时,该模块会生成一段Python代码来过滤、连接或聚合存储的日志。由于日志是完整且机器可读的,检索可以非常精确, , 代理可以询问“两个步骤前我正在解决的谜题中的第三个网格状态”,并准确得到该信息,而不是一个模糊的摘要。
作者在完整的公开ARC-AGI-3游戏集上测试了该设置,该游戏集包含200个训练谜题,涉及模式提取、规则归纳和多步转换。他们比较了四个前沿模型系列(GPT-4o、Claude 4 Sonnet、Gemini 2.5 Pro和Fable 5,后者是Anthropic在撰写本文时尚未公开细节的模型版本)的编码代理在有无PRO-LONG情况下的表现。
数据
在pass@1指标上,各模型的平均提升为18.0个百分点。最佳单项结果来自Fable 5:best@2得分97.4%,总推理成本为1,750美元。与针对ARC手工调整的最先进专用框架相比,PRO-LONG在pass@1上与之持平或超越(最高达76.1%),同时每次运行消耗的token减少了4.2到5.8倍。
这些token节省至关重要,因为token成本是实验室能承受的运行时长实际上限。如果一个框架在每次运行中消耗50美元,那么系统化测试就遥不可及。PRO-LONG的效率来自于将检索工作卸载到廉价的代码生成调用中,而不是将整个历史记录重新传入昂贵的推理模型。
对代理设计的启示
PRO-LONG并非新模型。它是一种脚手架技巧,利用了编码模型现在已足够优秀,能够对自己的记忆执行类似SQL查询这一事实。其启示在于,长程代理的瓶颈可能不在于模型能力,而在于上下文管理策略。
这与其他地方的研究发现一致。另一项2026年6月的分析估计,原始交互历史是办公助手代理的主要限制, , 一个需要15步完成的电子表格任务,如果代理无法回忆起第2步解析的列标题,就会崩溃。该分析提出的结构化状态加验证器工作流与PRO-LONG的诊断相同:不要让历史被动衰减,而是使其可查询。
注意事项
PRO-LONG在ARC-AGI-3(一个谜题基准)上的结果很强。同样的方法在开放式代码生成、多轮网页导航或长时间文档分析上是否有效,仍然是个开放性问题。作者随论文发布了代码和日志,这应有助于他人快速测试这一可移植性主张。
第二个注意事项是,该框架依赖于模型的代码生成能力。对于编写正确Python能力较弱的模型, , 例如较小的开放权重模型, , 检索步骤本身可能失败。该论文仅测试了前沿类模型。
尽管如此,其框架具有挑衅性。如果通往更好代理的最廉价路径是更好的记忆管理,而非更大的模型,那么该领域当前的许多方向(训练时间更长、规模更大)可能是在优化错误的东西。PRO-LONG是这一论点的一个有力数据点。
- 来源 : A new framework helps AI agents remember what they did five minutes ago — 2026-07-22
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。