人工智能
Grok 4.6 以 61 分与 GPT-5.6 Sol 并列,但分项得分分化明显
xAI 的 Grok 4.6 在 Artificial Analysis 智能指数(由九项基准综合而成)上与 GPT-5.6 Sol 并列 61 分。分项结果并不均衡:在知识工作与多数编程测试上领先,在 DeepSWE 和 Terminal-Bench 上落后。现已登陆 Cursor 和 Grok Build,起价为每百万输入 token 2 美元。

xAI 的新发布提出了一个观点:前沿模型的评判标准应该是它们能在多长的时间内持续执行一项任务,而不是回答单个提示词的速度。今日发布的 Grok 4.6 专为多步骤工作而构建:研究一个主题、分析信息、跨代码库工作、将一个想法推进到可运行的应用程序。xAI 表示,该模型能在这些任务轨迹中持续跟进复杂任务,并且在更长时间的执行中,会在继续之前开始检查自己的工作。
最受关注的数据是 Artificial Analysis 智能指数上的 61 分,该指数由九项基准综合而成。这使得 Grok 4.6 与 GPT-5.6 Sol 持平,比 Fable 5 的 62 分低一分。与 xAI 上一代发布相比,进步是明确的:Grok 4.5 在同一指数上得分为 56。
并列体现在综合指数上。xAI 公布的分项得分讲述了一个更加分化的故事。Grok 4.6 在所列基准中的六项上击败 GPT-5.6 Sol:GDPVal-AA v2(1753 对 1728)、CursorBench v3.2(69.9% 对 67.2%)、扩展版 FrontierCode v1.1(61.3% 对 60.6%)、APEX-Agents(57.5% 对 56.7%)、AA-Briefcase(1577 对 1502),以及 Harvey LAB 评估(Vals),它在该项上取得 15.8%,而对手为 2.5%。在 APEX-SWE 上,xAI 报告的得分为 56.4%,而 GPT-5.6 Sol 没有公布分数。失分集中在两行:DeepSWE v1.1 为 65.9%,对手为 73%;Terminal-Bench v3.0 为 26%,对手为 34.6%。
这两项失分对于一款主打长时间运行智能体的发布来说至关重要。两项基准都奖励长时间会话中的持续执行,而这正是该模型理应占据的领域。进步轨迹令人鼓舞:DeepSWE 从 Grok 4.5 的 54% 升至 65.9%,Terminal-Bench 从 15.7% 升至 26%,APEX-Agents 从 47.1% 升至 57.5%,这是 xAI 记分卡上最大的三个百分点增幅。但 GPT-5.6 Sol 在两项执行测试上仍保有 7 到 9 个百分点的优势,Fable 5 则领先 4 到 8 个百分点。
xAI 公布的记分卡
| 基准 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | n/a | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
每行最佳得分以粗体显示。据 xAI 的发布说明,竞争对手的数据取自各开发者公布的系统卡或基准排行榜。
Grok 4.6 如何训练:自建循环延续
训练故事延续了 xAI 在 Grok 4.5 上确立的模式, , 其训练环境由自主智能体而非人类工程师构建,这一细节由当时与 xAI 共同训练 4.5 的 Cursor 披露。对于 4.6,xAI 描述了一次比 4.5 更长的补充训练运行,输入数据包括精选的模型生成数据(用于推理和高级技术概念)、高质量工程数据,以及改进后的优化器和配方。随后,Grok 4.5 生成了涵盖推理任务、智能体框架、STEM、软件工程和知识工作的 SFT 轨迹,并利用基于模型的检查过滤掉不良轨迹。接下来的 RL 阶段覆盖了智能体任务,包括通用编程以及内核优化、Web 开发和计算机辅助设计等特定领域环境。
模型层面的结果与宣传口径一致。xAI 表示,Grok 4.6 尤其擅长将宽泛的产品想法转化为可运行的首个版本、研究陌生领域、搭建应用程序结构、实现核心交互,并通过多轮反馈进行打磨。它还报告称,在视觉和交互类工作上,Grok 4.6 的首轮产出通常强于 Grok 4.5,一次即可确立项目的结构和视觉语言。
运行平台与价格
Grok 4.6 今日在 Grok Build 和 Cursor 中上线,可通过 xAI API 使用,也可通过 OpenRouter、Vercel 和 Cloudflare 等合作伙伴获取。价格起价为每百万输入 token 2 美元、每百万输出 token 6 美元,快速版价格为两倍。为了让模型尽快交到用户手中,xAI 在头一周将 Grok Build 和 Cursor 的包含用量翻倍。
在安全方面,xAI 表示安全防护措施与模型扩展后的能力同步校准,并辅以其有史以来最广泛的部署前测试套件,以及部署后测试和第三方测试。此次发布明确将漏洞修补和加速工程设计周期等合法工作纳入范围。
与 GPT-5.6 Sol 的综合指数并列是真实存在的,但其背后的记分卡所显示的领先幅度比宣传口径所暗示的更为狭窄。Grok 4.6 在 xAI 瞄准的工作上获胜, , 知识密集型研究和交互式构建, , 而在最长的执行任务上落后。在 DeepSWE 和 Terminal-Bench 上,与 GPT-5.6 Sol 的差距为 7 到 9 个百分点。这个差距小到通过一个小版本更新即可弥合,又大到足以对这款模型所主打销售的这些工作负载产生实质性影响。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。