SevenTnewS

Messier语料库

957,253条记录无法掩盖差距:AI代理在编程领域猛增,但在企业需要的地方停滞不前

Messier语料库包含957,253条记录,涵盖30个基准,揭示了AI代理进展的不均衡:函数调用已饱和,编程改进最快,而企业工作流滞后。它还表明,严格的全通聚合可能掩盖收益并颠覆排行榜排名。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-02 · 阅读需 5 分钟

957,253条记录无法掩盖差距:AI代理在编程领域猛增,但在企业需要的地方停滞不前

多年来,任何试图跨基准比较AI代理的人都面临着一堆不兼容的任务、自定义脚手架、一次性验证器和孤立设计的评分规则。一个代理可能在某个排行榜上表现优异,却在另一个上表现糟糕,而无法判断差异是由实际能力还是评估设计造成的。这种碎片化使得几乎不可能回答唯一重要的问题:代理究竟在哪里变得更好?

2026年7月28日发布于arXiv的Messier语料库试图大规模回答这个问题。它整合了957,253条记录,涵盖30个基准、714个代理、11,891个任务和74,205个验证器。每条记录按模型、脚手架、环境、任务、验证器和聚合规则标准化,并标注了职业和行业代码。结果是首次对AI代理能力的高分辨率跨基准审视,并且画面并不全是光明的。

碎片化问题

现有的评估环境以著名的巴尔干化著称。不同的研究团队创建定制的环境,定义自己的成功标准,并在不兼容的脚手架上运行代理。即使两个基准测试相似的技能,结果也很难比较,因为测试平台、验证器或聚合规则以与代理本身无关的方式改变了分数。最近的基准OpenRTAG将图数据中的质量问题组织成3×3的分类法,发现不同模型家族类别(传统GNNs vs. 增强LLM的GNNs vs. 图基础模型)表现出不同的敏感性模式,这再次提醒基准设计选择深刻地影响了结果。同时,Mistral对自己的OCR 4审计显示,标准基准可能会惩罚那些事实正确但格式不符合预期模式的输出,从而产生掩盖真正收益的噪声。而MosaicLeaks研究表明,深度研究代理可以通过网络查询泄露私人数据,即使没有单个查询是有罪的,这是一个当前没有标准基准衡量的能力问题。

不均衡的前沿

Messier语料库证实,该领域的进步在基准类别上极不均衡。论文识别出三个不同的区域:

  • 函数调用,已饱和。代理在函数调用基准上的表现已经停滞,表明当前模型已经学会了现有测试所能衡量的工具调用机制。
  • 编程,激增。编程基准看到最快的改进,由代码生成和仓库级编辑的进步驱动。这与阿里巴巴HSCodeComp团队2024年7月的一项单独研究一致,该研究发现顶级代理在关税分类上的准确率仅为49.4%,而人类专家为95%,但这一上限是结构性的,不仅仅是计算问题。需要推理现实世界规则的编程任务仍然困难。
  • 企业工作流,滞后。模拟多步骤业务流程、审批链和特定领域工具使用的基准类别仍然最具挑战性。这一发现与阿里巴巴更广泛的战略一致,该战略专注于将企业锁定在集成的AI堆栈中,而不是赢得单个模型基准;也与Gartner的评估一致,即像Cursor这样的企业AI编码代理在愿景完整性方面领先,但70%的财富500强采用统计数字仍然忽略了这些部署中有多少是有限规模的试点。

全通过陷阱

或许Messier论文中最重要的发现是方法上的。当一个任务涉及多个验证器时,例如检查代理是否检索了正确的文档、提取了正确的字段并根据模式进行了格式化,许多基准使用严格的全通过聚合规则:只有当代理通过每一个验证器时才获得分数。Messier团队进行了反事实重新评分练习,发现这种全通过规则系统地低估了进展,特别是在更困难的多验证器任务上,并且可以人为地改变代理排名。一个通过九个验证器而失败一个的代理看起来与一个全部失败的代理相同。这呼应了早期PawBench研究的发现,该研究表明对于较小的模型,测试平台设计可以使分数波动超过11分,暴露了该领域评估代理管道的盲点。

持续存在的能力量表

如果来自不同基准的分数不能直接比较,我们能否至少推导出一个通用的能力量表?Messier团队正是这样做的。从标准化记录中,他们计算了能力量表,并针对Epoch评估能力指数进行了验证。对齐很强:Spearman等级相关系数为0.81。这表明语料库捕捉到了关于相对代理能力的一些真实信息,即使跨越不同的评估环境。这些量表还可以按领域、职业、动作空间或验证器类型进行专门化,使其可用于有针对性的审计,例如,询问代理在软件工程方面是否比法律推理更好,或者小型模型是否在某些工具使用类别中缩小了差距。

Messier对下一代基准的意义

Messier语料库本身不是一个基准。它是一个元评估基础设施,一种审计现有基准的偏见、死区和评分伪影的方式。论文将其定位为“一种基础的、可重用的基础设施,用于代理能力量表、基准审计和评估失败的细粒度分析。”它的发布恰逢该领域越来越认识到需要共享标准。最近的《Do Agent Benchmarks Measure Capability?》论文认为,协议有效性(评估协议是否实际测试了预期能力)需要明确的证据,没有它,分数可能毫无意义。Messier正好提供了进行这些协议有效性检查所需的跨基准证据基础。对于试图决定部署哪个代理的企业买家,或试图决定在哪里投资的研究人员,Messier提供了该领域一直缺少的东西:一张单一的、标准化的AI代理能力地图,包括其缺点和所有问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。