代理编程
Grok 4.5 如何在 SWE Marathon 上领先,这对编程代理意味着什么
Grok 4.5 现领跑 SWE Marathon 排行榜,击败 Claude 4 Opus 和 GPT-5。该基准测试真实的软件工程技能:跨真实仓库的 Bug 修复、功能添加与代码理解。这一结果重塑了 AI 编程代理的竞争格局。

软件工程基准测试在过去一年里经历了频繁的领跑者更迭。Claude 4 Opus 曾占据王座,GPT-5 也一度登顶。如今,Grok 4.5 坐上了 SWE Marathon 的头把交椅。该基准测试评估 AI 代理执行来自真实 GitHub 仓库的任务:修复 Bug、实现功能、处理 pull request,且这些代码库在训练中从未被其见过。
SWE Marathon 与大多数 LLM 基准测试不同。它不衡量知识回忆或数学推理,而是衡量代理能否导航陌生代码库、理解问题描述并生成正确的补丁。这些任务难度极高,人类工程师通常需要数小时才能解决。该基准发布通过率和置信区间,并将每次提交追溯到特定模型与配置。
Grok 4.5 在完整的 SWE Marathon 任务集上取得了 43.8% 的通过率。这明显领先于 Claude 4 Opus(40.5%)和 GPT-5(38.2%)。在“已验证”子集上差距较小,Grok 4.5 得分为 46.1%,Claude 4 Opus 为 44.0%,但整体图景不变:一个新的最高排名。

领先背后的驱动因素
SWE Marathon 排行榜的性能数据显示,Grok 4.5 在两类特定任务上表现出色:需要多文件编辑的复杂 Bug 修复,以及要求同时理解现有代码和新增规约的功能实现。该模型在涉及不熟悉的语言生态(Python 和 JavaScript 在基准测试中占主导地位,但 Grok 4.5 在 Rust 和 Go 任务上的表现优于此前领跑者)任务上也得分更高。
Claude 4 Opus 在对安全性或性能约束进行谨慎推理的任务上仍然更强,在这些方面它仍以微小优势领先于 Grok 4.5 和 GPT-5。GPT-5 是三者中平均速度最快的,完成任务的代理轮次更少,但其解决方案质量在最困难的四分位问题上有所不足。
| 模型 | SWE Marathon 通过率 | 已验证子集 | 最强任务类型 |
|---|---|---|---|
| Grok 4.5 | 43.8% | 46.1% | 多文件 Bug 修复 |
| Claude 4 Opus | 40.5% | 44.0% | 安全性感知补丁 |
| GPT-5 | 38.2% | 41.7% | 单文件添加 |
这意味什么
Grok 4.5 的领先并非侥幸。SWE Marathon 已运行一年多,每位新领跑者都以几个百分点的优势击败前一位。趋势线指向一个方向:编程代理在导航陌生代码库方面越来越强,而即便总体上限在提升,模型在这一特定能力上的差距也在缩小。
对评估编程代理的开发者而言,实际启示是:如果你的工作涉及多种语言或维护一个使用较冷门技术栈的代码库,Grok 4.5 值得一试。如果安全约束或性能回归是你的首要关注点,Claude 4 Opus 仍具优势。如果延迟比原始正确性更重要,GPT-5 在生成可工作补丁方面仍然最快。
它们中没有一个能解决软件工程中最困难的问题, , 架构决策、正确性与可维护性之间的权衡,或知道何时不应该修改代码。但 SWE Marathon 的数据表明,代理能做什么与需要做什么之间的差距,正以超出大多数开发者预期的速度缩小。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。