SevenTnewSAI 与科技新闻,深度解读

编程智能体 · Devin的双模型框架

每token多付2倍,反而让Devin的Fusion便宜了9%

Devin的Fusion让前沿主模型与更便宜的副手模型并肩运行,各自拥有独立上下文。Devin的基准测试表显示任务成本最多下降46%,其中一个案例中,每token成本翻倍的主模型反而带来了便宜9%的会话。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-26 · 阅读需 5 分钟

每token多付2倍,反而让Devin的Fusion便宜了9%

关于AI编程智能体成本的每一场争论,都是按token来打的。Devin的Fusion框架从今天起在Devin Desktop和Devin CLI中可用,它试图改变这个计价单位。它运行两个模型而非一个:前沿模型担任主模型,负责制定计划并审查工作;一个更便宜的模型担任副手,负责探索代码、实施改动、运行测试并回报结果。Devin推荐将Fable 5.1与SWE-2配对。

Devin称,在各大编程基准测试中,Fusion比其他模型框架最多高效39%。这些基准测试表,以及节省数字的计算方式,值得细读。

Fable 5每token贵一倍,完成成本却低9%

Devin最清晰的例子是其自身框架内的一次替换。根据该文章,将主模型从Opus 4.8换成Fable 5、副手保持不变后,会话平均成本降低9%,同时在FrontierCode上得分更高。Fable每token成本约为两倍。

副手模型对照表从另一侧说明了同一问题。在Astra担任主模型时,将GPT-5.6 Luna换成SWE-2,标价从每百万token 0.20美元升至0.75美元,涨幅275%,而Devin报告称,完成的FrontierCode任务成本为2.34美元,对比2.39美元,下降2%。

Devin的解释是,每token价格衡量错了对象。一个需要更多尝试、且其输出还需主模型纠正的便宜模型,在任务完成后可能反而更贵。

这里的每个数字都来自Devin及其合作伙伴

根据该文章,全部五行基准测试均与Artificial Analysis和Vals AI共同运行,节省幅度是相对于由单一前沿模型完成全部工作来衡量的。

基准测试Fable 5.1Fusion(Fable 5.1 + SWE-2)AstraFusion(Astra + SWE-2)
DeepSWE 1.164.3 / $14.6363.1 / $7.88(-46%)67.6 / $7.8867.3 / $4.69(-40%)
Terminal-Bench 457.6 / $17.4656.1 / $13.37(-23%)55.6 / $10.0850.0 / $6.06(-40%)
SWE-Atlas QnA64.8 / $7.5765.9 / $5.00(-34%)61.8 / $5.7259.4 / $3.59(-37%)
Vals Code Migration54.6 / $70.9757.3 / $42.00(-41%)67.7 / $44.3661.3 / $35.51(-20%)
FrontierCode 1.1 (Extended)63.6 / $2.6863.5 / $1.67(-38%)63.1 / $2.6263.4 / $2.34(-11%)

节省幅度并不均匀。最大降幅为46%,出现在Fable 5.1与SWE-2的DeepSWE 1.1上,得分从64.3滑落至63.1。最小降幅为11%,出现在Astra与SWE-2的FrontierCode 1.1 (Extended)上,得分从63.1微升至63.4。有两行让Astra组合付出了真实的准确率代价:Terminal-Bench 4从55.6降至50.0,换来40%的节省;Vals Code Migration从67.7降至61.3,换来20%的节省。

该文章没有引用任何独立复现,也没有来自无利益相关方的基准测试数字。Devin称,Fusion已在Devin Cloud上运行了数月。

任务中途切换模型带来的提示缓存问题

Devin反对模型路由的理由基于两点主张。初始提示并不能揭示任务有多难,因为“Fix xyz bug”可能是一行代码的边界情况,也可能是重构,差异只有在有人读过代码后才会显现。任务中途切换模型还会破坏提示缓存,把成本推回给昂贵的模型。

Fusion通过让两个模型常驻来避免切换。主模型和副手作为并行智能体运行,各自拥有持久上下文和自己的工具,交换的是简报、结果和反馈,而不是完整对话历史,因此各自保持缓存完整。

该文章没有点名任何在会话中途进行路由的竞品智能体,也没有引用已发表的路由研究。这一论点属于结构性论证。Devin没有报告任何针对路由智能体的实验。

对一种配对有帮助的指令,会伤害另一种配对

Fusion中最难复制的部分,是围绕配对的调优。Devin表示,它会针对每种组合调整框架,因为让一种配对高效的指令,可能让另一种配对变差。

  • 简报细节:面对较弱的副手时,Fable 5.1会写出更具规定性的简报,提前消耗主模型token以避免之后的审查轮次。面对SWE-2时,它会把更多实现细节留给副手。
  • 反驳:更强的副手被鼓励挑战主模型的计划,Devin称这能捕捉规划错误。允许较弱的副手坚持己见,会同时损害性能和成本。
  • 探索:规划所需的工作留给主模型,因为较弱的副手可能无法判断哪些信息重要。更强的副手则被允许参与初始探索。

Devin称最后这条边界是其研究中一个活跃领域。如果调优必须按配对重做,那么照搬双智能体设计却缺少调优的竞争者,无法复现这些数字。

如果买家转向按任务计价,token价格就不再能预测账单

Devin在结尾建议,从2026年起,模型以及模型与框架的组合应按照每任务价格而非每token价格来评判。认真对待这一点,采购上会得出两件事。副手的标价不再决定交易:SWE-2每token成本比Luna高275%,而Devin报告其完成成本略低。将前沿模型与最便宜的可用执行者配对也失去理由,因为最便宜的执行者往往正是昂贵模型不得不去修正的那一个。

这一切并非没有利益牵扯。Devin销售的框架,其价值取决于买家是否接受按任务计价,而目前唯一的证据来自其自家合作伙伴参与运行的基准测试。值得等待的比较,是一个竞争性的路由智能体,以相同方式、在相同任务上接受衡量。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。