SevenTnewS

AI智能体

Cursor的智能体集群从零重写SQLite:分数相同,账单天差地别

Cursor重新设计的智能体集群仅凭手册就用Rust重建了SQLite,并通过了全部验证套件,将合并冲突从7万多个降到不足1000个。每种模型组合都以截然不同的成本交付了相近的质量,这一差距才是核心。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-05 · 阅读需 6 分钟

Cursor的智能体集群从零重写SQLite:分数相同,账单天差地别

Cursor的智能体集群从空白页开始,在无源代码、无测试套件、无二进制文件且无网络的情况下,用Rust实现了835页的SQLite手册。评分依据是sqllogictest, , 该项目包含数百万条带已知答案的查询的测试套件, , 而它从未被告知该套件的存在。重新设计的测试框架的四种配置最终都100%通过了该套件。

该实验在相同任务、相同模型和相同时间预算下比较了旧版与新版框架。新版在每种配置中都击败了旧版。当Grok 4.5同时担任两个角色时,新版在四小时内达到80%,而旧版集群停滞不前,在第二个小时结束前就被暂停。Cursor提醒说,趋势比单次读数更重要:有些智能体在数小时内得分很低,随后才在后期猛涨;另一些则早早见顶然后进入平台期。

协调税:70,000次冲突

活动数据看起来像是生产力,直到你把它和结果放在一起。旧版Grok 4.5运行在头两个小时内产生了68,000次提交,约为新版运行速度的70倍,并堆积了超过70,000次合并冲突, , 冲突在加速而非平息。新版运行在四小时内记录的冲突不到一千次。旧版运行中争夺最激烈的文件吸引了来自1,173个不同智能体的7,771次冲突。新版运行中最热门的文件则出现了47次冲突。

最终代码显示出同样的差距。旧版运行横跨54个Rust crate,包括三个独立的SQL包,这是两位规划者在代码库不同角落悄悄构建同一事物的标志。Cursor称之为“脑裂”(split-brain)。新版运行最终稳定在九个crate上,且再也没有增加。在Fable 5组合中,旧版框架需要64,305行引擎代码才能通过测试套件;新版用9,908行就做到了。在Opus组合中:19,013行达到97%,而4,645行就达到100%。

速度倒逼工程。此前的Browser集群在Git上峰值接近每小时1,000次提交;新系统在Cursor从零构建的版本控制系统上峰值接近每秒1,000次。

围绕它的大部分修复是流程问题,而非模型智能。一个中立的第三方智能体会像人类合并队列那样解决合并冲突。执行者可以标记过大的巨型文件,阻止新提交,直到另一个智能体拆分该文件。设计决策进入共享文档,代码在编译时引用这些文档;当两位规划者相互矛盾时,一次对账会将文档合并,引用则会把解决方案传播到下游。智能体甚至可以在留下注释的情况下,故意在其职责范围之外做出破坏性更改,而每个受到影响的智能体都会读到那段推理。Cursor点名的一个失败模式是“僵化”(ossification):智能体已经学会不去触碰关键代码,即使它需要改变。

账单在哪里分道扬镳

经济层面的发现才是最值得借鉴的。Cursor表示,每一种模型分工都带来了相近的质量,而成本却差异巨大。使用GPT-5.5同时担任两个角色的运行,仅执行者一项就计费9,373美元。一次单独的GPT-5.5运行花费1,339美元。在四小时节点,新版运行处于73%到85%之间,旧版处于11%到77%之间,而每一种新版配置最终都完成了100%。

在每一次运行中,执行者消耗了至少69%的token,在多数运行中超过90%,但规划者的token成本更高。在Opus 4.8和Composer 2.5的组合中,Opus产生了少量token,却约占三分之二的成本。模型选择本身并不决定账单:Fable 5规划者的计费略低于Opus 4.8规划者,尽管其每token单价大约是其两倍,因为它使用的规划token少得多。而它的执行者消耗了数倍的token,运行成本因此显著更高。

大型任务中只有少数步骤需要前沿智能:初始分解、设计决策、某些仲裁。一旦顶级规划者将模糊性转化为明确指令,更便宜的模型只需执行它。同样的直觉也出现在其他智能体工程中。一个名为CodeRescue的路由系统利用执行反馈来决定廉价模型何时应该重试,以系统性升级35%的成本达到了近乎完美的解决率。

Cursor报告的四组配置对比情况如下:

规划者执行者报告结果
GPT-5.5GPT-5.5仅执行者一项计费9,373美元
Grok 4.5Grok 4.5四小时内sqllogictest达到80%;旧版框架在第二个小时前停滞
Opus 4.8Composer 2.5规划者约占三分之二成本;以4,645行引擎代码完成100%
Fable 5Composer 2.5第一小时内完成约三分之二测试套件;以9,908行引擎代码完成100%

规格成为工作单元

Cursor认为,模型能力的每一次跃升都提升了工程师工作的层级。自动补全让工程师从一行到一行,早期模型到代码块,智能体到文件和功能。到了集群,工作单元变成了规格:输入835页文字,输出一个数据库。稀缺的部分是把意图表达得足够好。集群开始像编译器一样,把一个目标分解成任务树,再逐步转换成可执行的工作。编译器在每一步都保持语义不变;集群在每一步都是概率性的,而Cursor描述的绝大部分机制都是为了弥合这一差距。罗纳德·科斯会认得这种形态:协调成本的增长快于工作本身,因此组织形成了有边界的层级,而不是所有人都与所有人对话。

有两个机制尤为突出。Field Guide是一个由智能体拥有的文件夹,其index.md在启动时按行数预算注入到每个智能体中。推理逻辑是:模型权重是冻结的,所以意外情况恰恰值得记录。Cursor还测试了审查角度,从执行者的完整转录到只看代码库,审查者使用不同的模型、训练运行和个性。没有任何单一角度能捕捉到一切,但去相关的角度会漏掉更少,就像自动驾驶系统在没有完美组件的情况下在总体上胜过人类。

一个脚注显示出这套技术栈仍然多么脆弱。Cursor原本想让GPT-5.6 Sol担任其旗舰配置,但新模型在处理字面化、执拗的措辞时失控了,于是它回退到GPT-5.5,而不是调整一个模型从而影响比较的公平性。框架的收益建立在仍然不稳定的模型行为之上。

Opus 4.8单独运行的成果已在 github.com/cursor/minisqlite 公开,任何人都可以拆解;Cursor表示它乍看之下非常出色,但尚未进行更深入的人工审查。底线是:框架从勉强可用变成了稳定可靠,而这种可靠性让模型组合变成了一个成本决策,而不是一次质量赌博。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。