3D推理
2 published articles
大语言模型与模型3 min read
3D推理
SceneActBench:为何最优秀的VLM在3D动作任务上也会失败
SceneActBench在统一的智能体循环中测试了11种VLM配置在五项3D任务上的表现。总体得分范围从38.6到50.2,没有模型表现稳定。该基准暴露了视觉语言智能体的一个盲点:对完整场景采取行动,而不仅仅是描述。
2026-07-31
人工智能4 min read
基准测试
牛津大学GauntletBench测试AI代理执行100个真实任务,它们失败了81%
牛津大学的GauntletBench对AI代理提出了100个具有挑战性的真实世界任务。前沿系统的成功率上限为19.1%,远低于人类表现。该基准测试针对五个专业应用中时间感知、图形理解和3D推理等被忽视的能力。
2026-07-01