SevenTnewS

成本与能力

物理测试中,1.40美元的模型击败了2.82美元的同门兄弟

四个 AI 模型被要求构建具有真实物理效果的 HTML 场景。Opus 5 以顶级模型中最低成本通过了所有三个测试,而 Fable 5 以两倍价格在每个测试中都失败了。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 3 分钟

物理测试中,1.40美元的模型击败了2.82美元的同门兄弟
来源 : Atomic.chat pos…

以实用AI基准测试闻名的平台Atomic.chat在周四发布了一项针对性测试。任务:编写三个HTML文件,模拟破坏物理, , 龙卷风卷起物体、拆球锤撞击建筑、卡车压断桁架桥。对于任何声称理解物体如何在空间中运动的模型来说,这应该足够简单。

四个参赛者:Opus 5(Anthropic)、Fable 5(Anthropic)、Kimi K3(Moonshot AI)和GPT 5.6(OpenAI)。Opus 5使用了55.9K个token,花费1.40美元。Fable 5使用了55.1K个token,但花费2.82美元,几乎翻倍。Kimi K3使用了35.7K个token,花费0.55美元。GPT 5.6使用了20.1K个token,花费0.31美元。便宜不一定更好,但Opus 5在该价格点上的表现不容忽视,尤其是考虑到它在其他基准测试中已知的成本优势

Opus 5 做对了什么

Opus 5交付了三个可工作的场景。它的龙卷风让房屋螺旋上升并飞出漏斗口,这是真实物理模拟应有的行为。拆球锤场景显示了墙壁撞击时开裂,瓦砾堆积在地面上。桥梁分阶段坍塌,卡车落入下面的河流。Atomic.chat给这三个场景都打了通过。这种性能正是你对一个模型的期望,正如更小的模型已经证明的那样,它不需要最大就是最好的。

Fable 5 在哪里栽了跟头

Fable 5的场景缺乏基本的物理一致性。它的龙卷风几乎没有什么地面物体可卷起,这违背了初衷。建筑在拆球锤到达之前自行倒塌。桥梁瞬间解体,没有渐进式破坏,没有中间状态。对于一个面向工程和编程的模型来说,这些都是令人尴尬的失败。

GPT 5.6 和 Kimi K3 落后

GPT 5.6最便宜,只要31美分,但它的拆球锤从未到达建筑,桥梁以现实生活中不可能的方式断裂。Kimi K3是来自中国的新参赛者,结果类似。尽管Kimi K3日益增长的受欢迎程度,它在物理推理上仍无法与Opus 5匹敌。

为什么这很重要

这个测试有限但具有启发意义。游戏、机器人和教育中的许多AI应用需要能够推理物体在空间中如何行为的模型。这是大多数以文本训练的大型语言模型已知的弱点。大型语言模型可以描述数据,但难以进行推理,这个基准测试凸显了这一差距。Opus 5表现良好而Fable 5没有,表明架构选择或训练数据可能产生重大影响。

成本也成为一个意想不到的转折。Opus 5以大幅优势击败了其更昂贵的同门兄弟。开发者在选购模拟模型时,最好在家族内横向测试,而不是认为更贵就更好,这一教训不仅适用于这个基准测试,现实部署也常常揭示这一点。

这个测试证实了研究人员之前注意到的现象:语言模型擅长句法,但常常在物理世界的语义上挣扎。Opus 5和Fable 5(均来自同一实验室)之间的巨大差距提醒我们,专业化需要权衡。如果你正在构建一个需要理解碰撞的机器人,你可能需要在选择模型之前,看看模拟栈是如何演进的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。