SevenTnewSAI 与科技新闻,深度解读

自主编码智能体 · arXiv 预印本

Harness-of-Harness 声称通过运行其他编码智能体实现 52.25% 的提升

HoH 将现有编码智能体 harness 包裹在重复的规划, 编码, 测试循环中,并报告在三个基准套件上平均取得 52.25% 的相对增益。摘要没有明确底层指标、资源成本以及按模型划分的结果。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-25 · 阅读需 5 分钟

Harness-of-Harness 声称通过运行其他编码智能体实现 52.25% 的提升

Harness-of-Harness 预印本于 2026 年 9 月 1 日发布在 arXiv 上,主张一种大多数智能体论文都会回避的分离。它不发布一个编码智能体,而是包裹已经存在的那些,并接管它们接下来要做什么。

HoH 将 harness 的运行组织为规划、编码和测试循环,然后重复这些循环,使每一轮都从上一次留下的成果开始。摘要声称,这个外层结构在不改动底层模型的情况下提升了性能:经过三次迭代后测得平均相对增益为 52.25%,最高为 82.86%。

主张:一个能改进其他 harness 的 harness

摘要大部分内容描述了 HoH 拒绝做什么。它约束什么才算可验证的输出,而不是规定智能体应如何工作,并将开发范围划分为可检查的小增量。写代码时进行的测试与独立运行的评估步骤保持分离。

接着是作者特别指出的平衡:修复与能力增长之间的平衡。一个只修复缺陷的循环能让项目维持下去,却无法推动其前进;一个只增加功能的循环则会积累破坏。HoH 被描述为在多次迭代中让两者保持张力,逐步而非一次性暴露交付物、工具和技能,并保留带版本的项目历史,使记录在运行结束后仍然存在。

52.25% 是什么的百分比?

这些增益是在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,相对于同一 harness 单独运行测得的。三次迭代产生了平均值;其中一组配对产生了最大值。摘要到这里就停了。

它从未说明改进的是哪项指标。52.25% 的相对增益可能是通过率、已完成任务数,或是作者为此场合定义的复合指标,读者无法从文本中分辨是哪一个。结果也没有按 harness、模型或基准拆分,因此平均值是唯一给出的数字。这里的承重词是“相对”:相对于低基线取得的增益,其绝对变化比听起来要小。

摘要中的说法文本实际明确的内容
平均相对增益 52.25%在三个 harness-模型配对、三次迭代之后
最高增益 82.86%同样三组配对中的最佳者、三次迭代之后
相较独立 harness 的一致改进三组配对均如此陈述;未给出每组数据
多日自主开发一个项目、70 多次迭代、一款第一人称射击游戏
成本、token 预算、墙钟时间未报告

七十次迭代,一款第一人称射击游戏

这个部署案例是传播最广的部分。据称,历经 70 多次迭代,HoH 产出了一款第一人称射击游戏,具备连贯剧情、实现的核心机制、人类可玩的构建版本,以及“打磨过的视觉效果和集成音频”。

射击游戏会测试命令行工具不会测试的东西:实时状态、输入处理、碰撞、以及在一个智能体重写它一小时前写过的文件后仍能存活的资源管线。HoH 的构建版本是否达到这一标准,是断言而非测量出来的。摘要没有提供帧率、没有试玩次数,也没有与规模相近的人类制作项目进行比较。“多日”也不是一个具体的天数,文本没有给出该次运行的计算量数据或人工干预次数。

模型与 harness 之争

这三组配对分别是 Codex 搭配 GPT-5.5、OpenCode 搭配 DeepSeek-V4-Pro,以及 Pi 搭配 MiniMax-M3。三个 harness 对应三个模型家族,对于一篇关于 scaffolding 的论文来说,这是恰当的结构。如果这个循环只帮助了它为之设计的那个 harness,整个想法就会看起来像是一个换了品牌的提示词配方。

摘要称,HoH 每一次都胜过对应的独立 harness,这是它不公布分项结果时能做出的最强主张。从文本看,它无法排除“投入更多”这一因素。一个运行更久、尝试更多变体、丢弃更多失败的迭代循环,在任何基准上都倾向于得分更高,而摘要中没有出现 token 预算、墙钟时间数字或成本核算。52.25% 中有多少来自更好的调度,多少来自在各方面投入更多,仍然悬而未决。

论文没有展示什么

这是一篇于 2026 年 9 月 1 日提交的预印本,每个数字都来自其作者。文中没有提到任何独立复现。列出三个公开基准会引发常见的污染问题,因为广泛流传的测试套件可能进入训练数据,而文本并未处理这一点。运行时间最长的演示, , 也是读起来最令人印象深刻的那一个, , 缺少资源核算。

这个结果很可能站得住脚。但就目前而言,它尚未得到验证,这是一篇新预印本的常态,也是应当在有人复现之前,不要对 52.25% 过于笃定的理由。

HoH 更有意思的论点藏在它的标题数字之下。如果编码智能体周围的循环本身就是一个可以寻找增益的地方,那么 harness 之间的竞争就和模型之间的竞争同样重要。这一主张有待复现来定论,而目前可供核查的内容还不多。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。