SevenTnewS

基准测试

AI桌面代理在前后测试中失败率达35%

DDB在2013个实例中测试了排序和前后配对任务。顶级模型在无诱饵序列上的精确匹配率为65.1%,有诱饵时为65.7%,揭示了代理在验证状态变化方面的差距。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-01 · 阅读需 3 分钟

AI桌面代理在前后测试中失败率达35%

能够导航桌面接口的计算机使用代理可以完成复杂的工作流程,但一项新的诊断基准显示,它们往往在没有真正理解其行为是否产生了预期的屏幕变化的情况下执行操作。在Desktop-Delta Bench(DDB)的排序任务中,顶级模型在无诱饵序列上的精确匹配率仅为65.1%,在有诱饵帧时仅为65.7%,这意味着它在大约35%的情况下失败。

DDB在2026年7月的一篇论文中描述,旨在填补现有评估中的空白。当前基准测试衡量最终任务成功或单帧定位,但两者都不测试代理是否能够重建屏幕之间的因果过渡。这一点之所以重要,是因为推理、输入、渲染和截图捕获是异步的:下一个观察可能延迟、遮挡或无关,而错误解读陈旧帧为进展的代理可能将错误带入后续规划。

三种失败模式

该基准测试针对三个失败维度:状态验证(动作是否真的改变了状态?)、源追踪(哪个元素导致变化?)以及上下文感知控制(动作是否本应执行?)。为了探索这些,作者从涵盖约15个应用程序和50个任务领域的新型多应用Linux轨迹中创建了2013个人工验证实例。两个互补任务覆盖了463个三帧时间排序实例,其中105个包含跨轨迹诱饵,以及1550个前后配对,标注有五个动作族及其负载。

排序仍然未饱和

对八组模型家族进行了测试,涵盖32个排序和16个单动作设置。排序结果显示了一致的差距。最佳模型在无诱饵三元组上的精确匹配率为65.1%;在有诱饵三元组上为65.7%。有趣的是,提供任务上下文使诱饵识别提高了6.9个百分点,但使无诱饵精确匹配降低了2.2个百分点。错误分析显示,模型系统地复制了给定的A-B-C顺序,而非推断正确序列,这表明它们依赖表面模式而非因果理解。

动作识别比动作推断更容易

单动作结果遵循不同模式。识别动作族比定位动作更难。点击检测达到0.96的高F1分数,但拖拽检测仅为0.76。然而,一旦识别出拖拽,其定位通常准确。这表明当前模型处理离散、局部动作(如点击)远好于连续、空间动作(如拖拽)。

验证成为新瓶颈

DDB的发现呼应了AI研究的更广泛趋势:生成速度超过验证速度。2026年6月的一篇论文《验证地平线》认为,随着模型越来越擅长生成候选解决方案,验证这些方案成为更难的问题。DDB显示,同样的张力也适用于桌面代理:生成点击很容易;验证它是否产生了预期的屏幕变化却很难。先前比较GUI和CLI代理的工作(在DDB之前一个月发表)发现,仅有屏幕的代理在长周期工作流程中遇到了执行瓶颈。DDB表明,部分瓶颈可能源于对过渡理解的不足。

对于企业自动化,这一盲点带来了真实风险。无法可靠区分真实过渡与陈旧帧的代理可能会跳过步骤、重复操作或带着错误信息静默继续。DDB提供了一种有针对性的方式来衡量和改进这一能力,然后代理才能被信任用于高 stakes 任务。

通过用步骤级诊断层补充最终任务基准测试,DDB填补了感知与规划之间的评估空隙。作者认为,提高桌面代理的可靠性需要更好的机制来检测动作何时实际修改了界面,这是安全恢复和长周期规划的前提。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。