1 published article
3D推理
SceneActBench在统一的智能体循环中测试了11种VLM配置在五项3D任务上的表现。总体得分范围从38.6到50.2,没有模型表现稳定。该基准暴露了视觉语言智能体的一个盲点:对完整场景采取行动,而不仅仅是描述。
2026-07-31