SevenTnewS

AI研究

工具链进化看起来令人印象深刻,直到你在未见过任务上测试它

自动工具链进化本应让LLM智能体变得更好,但一篇新论文认为,许多报道的收益可能来自对公开测试集的过拟合。在实验中,简单的测试时扩展方法匹配或优于进化,而进化后的工具链在未见过的任务上表现有限。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-27 · 阅读需 3 分钟

工具链进化看起来令人印象深刻,直到你在未见过任务上测试它
来源 : Rethinking Harn…

这篇论文可在arXiv上以编号2607.12227获取,是一份直截了当的方法论批评。它重新审视了自动工具链进化(即利用单元测试反馈迭代搜索更好工具链配置的做法)通常是如何评估的,并发现标准协议从根本上存在缺陷。

两个核心担忧简单且明确。首先,工具链进化本身就是一个消耗推理计算和任务反馈的搜索过程。要知道其收益是来自更好的工具链设计,还是仅仅来自额外的搜索,你必须将其与同等代价的基线(并行采样、顺序细化)进行比较,这些基线获得相同的反馈但不改变工具链。论文认为,这种基线几乎从未运行过。

其次,如果你在报告的同一基准上进行搜索,那么你测量的是工具链适应特定任务集的能力,而不是改进的可迁移性。论文直截了当地指出了这一点:报道的收益可能过拟合于该特定任务集。

实验的实际发现

图表:Terminal-Bench 2.1上的工具链进化与基线对比
文章报告,在匹配推理预算下,自动工具链进化并未始终优于这些模型的并行采样或顺序细化。

在Terminal-Bench 2.1上,使用GPT-5.4和Claude Opus 4.6,研究人员在匹配推理预算下比较了工具链进化与简单的测试时扩展方法。结果并不利于主流叙述。

自动工具链进化并未始终优于简单的并行采样或顺序细化,即使有单元测试反馈可用。当搜索和评估任务分离时(即进化后的工具链在进化过程中未见的任务上测试),改进微乎其微。

作者谨慎避免过度陈述。他们的结论并非工具链进化无效,而是其收益需要利用公平的设置、具有可比预算的强基线和真正对工具链设计敏感的基准来评估。

这呼应了AgentScope团队的相关工作,该工作发现工具链设计可以使较小模型的得分波动超过11点,但早期工作是关于评估工具链而非进化它们。新论文将同一原则扩展到进化过程本身:如果工具链很重要,那么从搜索伪影中正确分离其效果也同样重要。

这对领域为何重要

这篇论文发表之际,AI智能体生态系统正急需可靠评估。Semantic Scholar标记的相关论文列表本身就具有启示性:包括《Do Agent Optimizers Compound?》《SEAGym》《MemoHarness》《Harness Updating Is Not Harness Benefit》《Evolving Agents in the Dark》《Self-Harness》和《TTHE: Test-Time Harness Evolution》, , 整个子领域正在围绕如何评估评估者的问题形成。

这一批评还提出了关于智能体评估流程的更广泛问题。正如我们早前报道中所指出的,工具链设计可以使较小模型的得分波动超过11点。如果进化增加了另一层未与测量正确分离的搜索,那么该领域就面临建造纸牌屋的风险,其中报道的分数反映的是搜索深度和基准熟悉度,而非真正的智能体能力。

代码可在 https://github.com/rethinking-harness-evolution 获取,供任何希望复制实验或将其扩展到其他模型族和任务集的人使用。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。