SevenTnewS

3D推理

SceneActBench:为何最优秀的VLM在3D动作任务上也会失败

SceneActBench在统一的智能体循环中测试了11种VLM配置在五项3D任务上的表现。总体得分范围从38.6到50.2,没有模型表现稳定。该基准暴露了视觉语言智能体的一个盲点:对完整场景采取行动,而不仅仅是描述。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 阅读需 3 分钟

SceneActBench:为何最优秀的VLM在3D动作任务上也会失败

视觉语言模型能生动地描述房间的细节, , 书架、台灯、桌上的杯子, , 但若要求它们把杯子放到架子上,表现便会急剧下降。描述与行动之间的差距,正是这个由学术团队打造的新基准所要测量的。

缺失的维度:为何3D动作如此重要

现有的3D基准往往只做两件事之一:对关于场景的文本回答进行评分,或测试单物体操作(如拿起一个立方体)。这两种方式都无法捕捉智能体在完整多物体空间中需要推理、规划动作序列并通过工具接口执行的复杂现实。

这一差距之所以重要,是因为越来越多的研究实验室正在构建旨在对3D环境采取行动的VLM智能体, , 仓库机器人、家庭助手、基于仿真的设计工具。牛津大学的GauntletBench(今年早些时候发布)已指出,智能体在3D建模等专业应用的3D推理任务中存在问题。SceneActBench则从纯研究角度深入探究同一弱点。

SceneActBench内幕:设计、任务与智能体循环

该基准涵盖五项3D任务,基于210个源实例构建,生成520个任务案例(包括配对输入条件)。每项任务要求智能体使用PNG图像或采样视频帧作为输入(某些任务还提供3D资产)对3D环境采取行动。关键设计选择:所有任务通过一个固定的智能体循环运行,确保各配置间公平比较。最终输出通过特定任务的几何指标与隐藏的真实情况进行评估。

这种统一循环很重要。许多早期基准允许研究人员为每个模型调整评估管道,导致分数难以比较。SceneActBench采用与牛津GauntletBench相同的方法, , 一个模块化但标准化的管道,旨在不再隐藏智能体真正失败的原因。

数据讲述的故事:得分从38.6到50.2

研究团队测试了11种专有VLM配置。总体得分范围从38.6到50.2,意味着即使最好的模型也勉强超过中间值。而且没有一种配置在所有五项任务中表现一致。这与其他严格基准中观察到的模式相呼应:不久前在编程基准上击败137B模型的3B参数模型也表明,当评估严格时,更小、更专注的架构能与更大模型相抗衡。这里分数差距不大,暗示当今VLM在3D动作方面存在相似的能力上限。

摘要部分未按任务细分得分,但研究人员报告分析了失败发生的地点和方式。早期迹象表明,物体持久性(追踪被遮挡的物体)以及事件顺序(如扫描后放置)是常见的困难点。

这些失败对VLM研究意味着什么

这些结果与近期其他发现一致。Sakana AI领导的一个团队在Picbreeder平台上用VLM代替人类用户后发现,合成存档缺乏人类创建存档的勇气和多样性, , 模型在开放式探索上陷入停滞。类似地,在减轻视觉幻觉的研究中,轻量级训练模块可以将基于真实性的基准分数提升几个百分点,但差距仍然很大。

SceneActBench明确的一点是:VLM领域需要测试行动而非仅仅是感知的基准。一个在图像描述甚至单物体操作上得分高的模型,在要求协调视觉、空间推理和完整场景中顺序动作时仍可能失败。这个盲点不会仅仅通过扩大模型规模来自动解决。它需要评估套件来精确推动当前套件缺失的维度, , 时间顺序、多物体推理和精确的空间执行。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。