SevenTnewS

模型竞赛

LiveBench排行榜:边际收益渐微的研究

GPT-5.6 Sol以82.4的平均分在LiveBench上夺得总冠军,但Claude Fable 5仅落后1.6分,成本却高出近三倍。真正的故事在于下方梯队已经明显减少。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-22 · 阅读需 4 分钟

LiveBench排行榜:边际收益渐微的研究
来源 : LiveBench

LiveBench发布了最新更新,排行榜的格局耐人寻味。顶部被两个实验室主导:OpenAI的GPT-5.6 Sol和Anthropic的Claude Fable 5,综合得分仅差一个四舍五入的误差,但价格却天差地别。

GPT-5.6 Sol Max Effort总平均分为82.4。Claude Fable 5 Max Effort为80.8。这1.6分的差距,如果使用Anthropic的顶级配置,每token成本高出近2.7倍。同一系列中较便宜的变体GPT-5.6 Terra得分为79.8,更接近顶级Claude,而非Sol与Fable之间的差距。高端投入的边际回报微乎其微,且迅速压缩。

各模型的强项

总体平均分掩盖了真正的类别级差异。Claude Fable 5在写作方面以90.7分领先,与GPT-5.5 Thinking和Claude 4.8 Opus Thinking持平,比GPT-5.6 Sol的87.7分高出整整3分。如果你的主要负载是散文,Claude Fable是明确的选择,而最接近的GPT变体(5.5 Thinking)每token成本为0.53美元,而Fable为1.57美元。

图示:顶级模型综合得分 · 类别得分:GPT vs Claude · 价格-性能曲线
根据文章,前三名模型LiveBench综合得分在2.6分之内。根据LiveBench数据,前两名模型在类别层面上的差异。根据文章数据,各价格区间的综合得分显示顶尖附近的边际收益递减。

推理方面的情况更为复杂。GPT-5.6 Sol在推理基准测试中达到96.2分,略高于Claude Fable的96.0分和GPT-5.5 Thinking的95.9分。这些都在误差范围内。真正的下降发生在前四名之后:Gemini 3.1 Pro Preview得分为91.0分,Claude 4.7 Opus Thinking得分为92.9分。之后,分数迅速跌至80多分。

数学仍然是GPT系列的强项。GPT-5.6 Sol以91.7分领先,其次是GPT-5.6 Terra的90.6分和GPT-5.5 Thinking的89.7分。Claude Fable 5以89.7分与GPT-5.5分数持平,但Claude 4.8 Opus Thinking同样以89.7分落后,纸面上完全相同。差异很小,以至于一个糟糕的随机种子就能翻转排名。

编码结果显示出更大的差异。GPT-5.6 Sol的编码得分为83.9分。Claude Fable 5得分为86.0分。数个Claude系列变体在编码方面优于GPT:Claude Sonnet 5为80.7分,Claude 4.6 Opus Thinking为78.2分,但无一能与前两名匹敌。编码排行榜是唯一一个来自双寡头之外模型的类别:Gemini 3.1 Pro Preview以76.5分,进入下一梯队可触及的距离。

预算区间:开源模型与局外者

在75分以下,领域内涌现了大量有趣的选择。开源权重的DeepSeek V4 Pro以每token 0.05美元的平均得分71.6分,价格约为Claude Fable 5的约30分之一,性能约为其综合分数的89%。同样开源的Kimi K3得分为78.5分,成本为0.379美元,使其成为70多分区间的最佳性价比选择。Qwen 3.7 Max得分为73.1分,成本为0.182美元,在同一价位区间与得分为69.6分、成本为0.091美元的GPT-5.4 Nano具有竞争力。

Grok 4.5得分为76.3分,成本为0.128美元,是一个值得关注的新来者:它在综合得分上击败了数个更高价位的Claude和GPT变体,而成本却只有其零头。其弱点在于写作(68.6分)和编码(70.8分),但推理得分90.8分确属顶级。如果xAI能针对这些弱点进行迭代改进,该系列有望迅速攀升排行榜。

顶部的收缩

此次更新最引人注目的特点是,前四名模型相互之间的差距均在2.2分以内,而其他所有模型得分则平滑下降。这并非AI实验室喜欢展现的指数级进步曲线。而是一条以指数级成本换取增量收益的长尾曲线。GPT-5.6 Sol与GPT-5.4 Nano在综合得分上相差12.8分,但价格差距约为6.5倍。付出更多确实能获得更多,但曲线正在趋于平缓。

对于任何大规模部署而言,最理想的价位大概是在0.10美元至0.20美元区间,Grok 4.5、DeepSeek V4 Pro和Qwen 3.7 Max等模型正位于此。它们对大多数生产负载而言已经足够好,与顶级梯队之间的成本差异,足以支撑大量的评估运行,而在准确性提升方面达到盈亏平衡点。

LiveBench数据并不能说明哪个模型最好, , 这取决于你的任务和预算。但它确实表明,最佳与优秀之间的差距正在缩小,而最佳模型变得更贵的速度,快于它变得更好的速度。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。