VLM
2 published articles
大语言模型与模型3 min read
3D推理
SceneActBench:为何最优秀的VLM在3D动作任务上也会失败
SceneActBench在统一的智能体循环中测试了11种VLM配置在五项3D任务上的表现。总体得分范围从38.6到50.2,没有模型表现稳定。该基准暴露了视觉语言智能体的一个盲点:对完整场景采取行动,而不仅仅是描述。
2026-07-31
实验室与研究Featured3 min read
开放性探索与视觉语言模型
Sakana AI的Picbreeder实验揭示视觉语言模型对人类创造力的理解缺失
由Sakana AI领导的研究团队用视觉语言模型替换了Picbreeder的人类用户,发现合成存档缺乏人类原版的胆识和多样性。他们利用噪声、记忆以及数千个提示生成的个性进行的实验,揭示了将大模型用于开放性发现的潜力与局限。
2026-07-20