SevenTnewS

代理编程

Grok 4.5 如何在 SWE Marathon 上领先,这对编程代理意味着什么

Grok 4.5 现领跑 SWE Marathon 排行榜,击败 Claude 4 Opus 和 GPT-5。该基准测试真实的软件工程技能:跨真实仓库的 Bug 修复、功能添加与代码理解。这一结果重塑了 AI 编程代理的竞争格局。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-20 · 阅读需 3 分钟

Grok 4.5 如何在 SWE Marathon 上领先,这对编程代理意味着什么
来源 : SWE Marathon be…

软件工程基准测试在过去一年里经历了频繁的领跑者更迭。Claude 4 Opus 曾占据王座,GPT-5 也一度登顶。如今,Grok 4.5 坐上了 SWE Marathon 的头把交椅。该基准测试评估 AI 代理执行来自真实 GitHub 仓库的任务:修复 Bug、实现功能、处理 pull request,且这些代码库在训练中从未被其见过。

SWE Marathon 与大多数 LLM 基准测试不同。它不衡量知识回忆或数学推理,而是衡量代理能否导航陌生代码库、理解问题描述并生成正确的补丁。这些任务难度极高,人类工程师通常需要数小时才能解决。该基准发布通过率和置信区间,并将每次提交追溯到特定模型与配置。

Grok 4.5 在完整的 SWE Marathon 任务集上取得了 43.8% 的通过率。这明显领先于 Claude 4 Opus(40.5%)和 GPT-5(38.2%)。在“已验证”子集上差距较小,Grok 4.5 得分为 46.1%,Claude 4 Opus 为 44.0%,但整体图景不变:一个新的最高排名。

图形:各模型 SWE Marathon 通过率
Grok 4.5 以 43.8% 的通过率领跑 SWE Marathon 基准测试,领先于 Claude 4 Opus(40.5%)和 GPT-5(38.2%),根据文章数据。

领先背后的驱动因素

SWE Marathon 排行榜的性能数据显示,Grok 4.5 在两类特定任务上表现出色:需要多文件编辑的复杂 Bug 修复,以及要求同时理解现有代码和新增规约的功能实现。该模型在涉及不熟悉的语言生态(Python 和 JavaScript 在基准测试中占主导地位,但 Grok 4.5 在 Rust 和 Go 任务上的表现优于此前领跑者)任务上也得分更高。

Claude 4 Opus 在对安全性或性能约束进行谨慎推理的任务上仍然更强,在这些方面它仍以微小优势领先于 Grok 4.5 和 GPT-5。GPT-5 是三者中平均速度最快的,完成任务的代理轮次更少,但其解决方案质量在最困难的四分位问题上有所不足。

模型SWE Marathon 通过率已验证子集最强任务类型
Grok 4.543.8%46.1%多文件 Bug 修复
Claude 4 Opus40.5%44.0%安全性感知补丁
GPT-538.2%41.7%单文件添加

这意味什么

Grok 4.5 的领先并非侥幸。SWE Marathon 已运行一年多,每位新领跑者都以几个百分点的优势击败前一位。趋势线指向一个方向:编程代理在导航陌生代码库方面越来越强,而即便总体上限在提升,模型在这一特定能力上的差距也在缩小。

对评估编程代理的开发者而言,实际启示是:如果你的工作涉及多种语言或维护一个使用较冷门技术栈的代码库,Grok 4.5 值得一试。如果安全约束或性能回归是你的首要关注点,Claude 4 Opus 仍具优势。如果延迟比原始正确性更重要,GPT-5 在生成可工作补丁方面仍然最快。

它们中没有一个能解决软件工程中最困难的问题, , 架构决策、正确性与可维护性之间的权衡,或知道何时不应该修改代码。但 SWE Marathon 的数据表明,代理能做什么与需要做什么之间的差距,正以超出大多数开发者预期的速度缩小。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。