SevenTnewSAI 与科技新闻,深度解读

基准测试分析

在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%

SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。

Emmanuel Fabrice Omgbwa Yasse

2026-08-02 · 最后更新:2026-08-03 · 阅读需 2 分钟

在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%
来源 : Évaluation et B…·SWE-bench — off…·SWE-bench: Can …

SWE-bench通过向模型提供从真实GitHub仓库提取的实际bug报告或功能请求来评估模型,然后检查其编写的补丁是否能让仓库现有的测试套件通过。没有合成的函数桩,没有为了简单而编写的文档字符串。只有一个问题、一个代码库以及由模型出现之前就已存在的测试定义的通过/失败标准。

在SWE-bench Verified, , 一个经过人工审核的公共问题精选子集上,结果现在看起来几乎已经解决。GPT-5.6 Sol达到96.2%。Claude Mythos 5达到95.5%。Claude Fable 5达到95.0%,GPT-5.6 Luna达到93.0%,甚至中游模型如Claude Opus 4.8和Kimi K3也在88%到89%左右。单独看这些数字,前沿模型似乎已经基本掌握了真实世界中的bug修复。

接下来是SWE-bench Pro

SWE-bench Pro的存在正是为了测试那个数字所邀请的假设:这是否具有普遍性,还是模型只是在针对这个特定的、被反复使用的公共数据集上变得非常擅长?Pro换用了来自私有、近期创建的企业仓库的问题,这些代码库没有机会像多年的公共GitHub问题那样泄露到预训练数据中。

结果与Verified数字相差甚远。GPT-5和Claude Opus 4.1这些在公共SWE-bench上名列前茅的模型,在SWE-bench Pro上下降到23.1%到23.3%之间。进一步将测试限制在严格保密的保留子集, , 任何模型提供商都不可能以任何形式看到过的仓库,性能再次下降,降至14.9%到17.8%的范围。

70个百分点的差距实际上在衡量什么

这不是一个小的校准差异。这是一种不同的能力。一个能解决96%的公开、文档完善、曾被讨论过的GitHub问题,但仅能解决15%的私有企业问题的模型,并不是在某种抽象意义上编程失败,而是揭示了其表面技能中有多少是由先前接触到的公共仓库的特定模式、讨论甚至先前修复所塑造的。剥离这种熟悉感,剩下的就是衡量模型是否能在不熟悉的代码库中进行推理的一个更粗略的指标。

这是当前基准测试中最尖锐的例证,体现了一种一旦你寻找就会无处不在的模式:在公共、知名测试上的表面精通,往往在与真正新颖、私有的条件接触时无法延续。对于决定是否信任一个代理使用真实生产代码库的工程领导者来说,重要的不是Verified数字,而是SWE-bench Pro数字。这也是实验室更难放到幻灯片上的数字。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。