人工智能
为什么你的AI智能体在处理长任务时会失败于工作记忆
一篇学术论文引入了StructAgent,一个以状态为中心的框架,重新构建了数字智能体追踪任务进度的方式。它在OSWorld-Verified基准上使用开源模型达到了最先进水平,并泛化到Minecraft。该研究指出,原始交互历史是长周期任务的瓶颈,并提出结构化状态加验证器支持的工作流作为解决方案。

当AI智能体被要求打开电子表格、提取数据、更新图表并通过电子邮件发送结果时,典型的方法是为其提供不断增长的截图、鼠标点击和系统响应日志。随着任务跨越数十个步骤,那段原始历史就变成了沼泽。关键信息, , 文件路径、已验证的编辑、URL, , 被失败的尝试和陈旧的观察所掩埋。
这正是加州大学圣迭戈分校与Aether AI Lab的研究人员试图通过StructAgent解决的问题。该框架的核心见解听起来几乎自相矛盾:为了让智能体在长任务中更可靠,赋予它们更少的上下文。但它保留的上下文必须是结构化的、经过验证的,并与实际推进任务的内容存在因果关系。
在一篇新论文报告的实验中,StructAgent将拥有90亿参数的模型在OSWorld-Verified(一个用于长周期计算机操作的基准)上的成功率从27.0%提升到了46.9%。使用更强的270亿参数骨干网络时,成功率从31.6%跃升至62.2%。使用MiniMax-M3模型时,达到了78.9%,创下了该基准上开源方法的新纪录。
作者引用了Edsger Dijkstra的话:“抽象的目的不是为了模糊,而是为了创建一个新的语义层次,在这个层次上可以做到绝对精确。”这篇论文可被视为将该原则应用于智能体设计的延伸论证。
原始历史问题
当前的数字智能体,无论是基于LLM还是VLM,通常都将交互历史作为平面序列来消费:截图、无障碍树、动作输出。经过多个步骤后,该上下文会增长到包含中间编辑、失败的尝试和部分完成。智能体没有原则性的方法来区分哪些重要,哪些不重要。
StructAgent用一个包含三种类型组件的统一状态来替换这种处理方式:当前需求、有用值(文件路径、URL、提取的数据)和已验证的证据。不是从不断增长的日志中推断进度,而是每个模块, , 规划器、执行器、验证器, , 都读写这个共享状态。关键规则是,没有经过验证器支持的决策,就不能提交任何进展。
工作原理
该框架运行一个循环。规划器读取当前状态并选择一个子目标。执行器在环境中尝试该子目标。验证器检查是否取得了有效进展。只有当验证器找到证据时,状态才会更新。这比执行器自行声明完成或由最终评判者仅检查最终截图的方法更为严格。
验证器使用结构化探查:它可以检查磁盘上的文件、命令输出、URL、无障碍树,而不仅仅是屏幕。例如,在一个多应用任务中,执行器可能看起来从文档导出了一张图片,但验证器可以检查文件系统是否有实际导出的文件。如果文件丢失,子目标将保持待定状态,从而阻止错误的完成。
这种规约实现了若干能力:进度检查点(状态本身就是一个恢复点)、针对性失败恢复(验证器诊断失败是由缺少证据、冲突需求还是环境阻塞器造成的)以及工具辅助执行(仍需要验证器支持提交的可重用过程)。
数据
在OSWorld-Verified上的控制实验使用了100步的预算和一个通用的评分流程。结果显示,StructAgent改善了每一个测试过的骨干网络,其中在较弱的模型上收益最大。这意味着该框架弥补了模型从原始历史中提取信号的能力有限的问题。
办公应用(电子表格、文档)的改进最为明显,这很可能是因为这些环境暴露了持久的中间状态,如单元格值和文件内容。跨应用任务仍然是最难的设置。即使使用最强的骨干网络,多应用场景的性能也落后于更简单的领域。验证器的证据面在跨应用边界时可靠性较低。
该框架的泛化能力超出了桌面环境。在Minecraft中,StructAgent用基于库存的检查取代了桌面证据源。它在五个工具层级上实现了76%的任务加权平均成功率,而公布的Optimus-1基线为59%。最大的收益出现在铁和金层级,其中长的依赖链使得经过验证的子目标追踪特别有用。
为何重要
StructAgent的出现正值AI行业大力推动智能体系统,即能够长时间自主行动的模型。但OSWorld-Verified这样的基准显示,即使是最好的模型也会在长任务上失败。该论文将问题定位为智能体设计问题,而不只是模型规模问题。其方法将验证从最终关口重新定义为一个持续的承诺机制。
对得分为零的轨迹的失败分析甚至揭示了StructAgent自身的一些情况。执行器失败占案例的33%,但规划器和验证器失败各占30%。没有单一模块能解释所有失败,作者认为这支持了系统级观点:长周期可靠性需要更好的证据设计、更强的验证器训练以及领域感知的执行支持。
该论文还显示,结构化验证优于纯视觉验证。当结构化验证器和视觉验证器意见不一致时,在人工审查的100个中间案例中,结构化验证器正确率为63%,而纯视觉验证器仅为31%。优势来自于潜在证据:文件、命令输出、URL等无法可靠地显示在截图中的内容。
开放问题
StructAgent的最大收益出现在环境暴露可检查状态(文件、URL、可访问的数据结构)时。在纯视觉领域,一些浏览器任务和图像密集型应用的优势会缩小。该论文建议将更丰富的应用特定检查和验证器训练作为下一个瓶颈。
另一个开放问题是这种方法如何扩展到更长任务或多智能体设置。状态抽象被设计为可在模块间共享,但该论文并未测试多智能体场景。作者在结论中指出,这种范式可以扩展到Web智能体、具身智能体以及多智能体协作,但将实现留作未来工作。
StructAgent也无法逃脱验证的成本。每次调用验证器都会增加延迟和计算量。对于实验中使用的100步预算,这种开销是可管理的,但对于运行数千步的任务,验证器本身就会成为瓶颈。
尽管如此,这些结果很难被忽视。无需扩展模型,就能将拥有90亿参数的模型在困难基准上的成功率从27%提升至47%,这表明智能体追踪自身进度的方式可能与模型的原始能力同等重要。该论文的核心论点, , 长周期执行需要一种用于进展的因果结构,而不仅仅是一个更大的上下文窗口, , 随着智能体任务变得更长,行业很可能需要面对这个问题。
StructAgent的代码和项目页现已公开。作者已表示,以状态为中心的设计并不仅限于桌面任务,而是一种使智能体能够诚实追踪已完成和未完成的工作的通用范式。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。