基准测试
新基准显示,前沿AI视觉模型在基础感知任务上表现不佳
PerceptionBench通过3000个问题测试十项原子视觉能力。没有前沿模型突破60%,相似的整体分数掩盖了截然不同的弱点分布。

一项名为PerceptionBench的新基准表明,多模态AI模型表面理解与实际感知之间的差距比许多人想象的要大。在针对16个前沿模型的测试中,没有一个模型在旨在衡量原子视觉感知的问题上达到60%的准确率, , 原子视觉感知指的是不依赖推理或背景知识而看到单一、明确视觉事实的能力。
现有基准通常将感知与推理混在一起,使得难以判断错误是因为模型没有看到物体还是因为无法进行推理。PerceptionBench团队在arXiv上发布了33页的预印本,着手隔离感知问题。他们分析了模型在42个现有基准上的最早失败点,并构建了一个错误分类法。团队检查了模型在一系列多样化任务中首次出错的环节,确保分类法反映了真实错误。根据这一分类法,他们推导出十项原子感知能力,每项都是解释视觉场景所需的最小技能。
该基准包含3000个经过验证的问题,每个问题旨在测试单一能力。难度来自感知需求本身,而不是复杂的指令或领域知识。答案简短且明确:一个数字、一个颜色词或是否。这消除了评分歧义,并使测试可在不同研究团队间重复。
结果令人警醒。没有模型整体达到60%的准确率。与感知相关的幻觉是最弱的能力。更有说服力的是,整体分数相似的模型往往有着截然不同的能力分布。一个模型可能在颜色检测上表现出色,但在计数上失败。另一个可能在空间关系上很强,但在纹理上很弱。一个在视觉问答数据集上表现良好的模型仍然可能无法计数杂乱场景中的物品。总体分数掩盖了失败的真实分布。
这种诊断粒度是PerceptionBench与早期整体基准的区别所在。它不是用一个单一数字对模型进行排名,而是让研究人员看到哪些感知技能缺失,并相应地调整训练或架构。作者指出感知准确率与幻觉频率之间存在强相关性,表明修复基础感知能力可能全面减少幻觉。
该基准还突显了一个更深层次的问题:当前的训练方法并未明确教模型在推理之前进行感知。这些模型将感知作为语言对齐目标的副产品来学习,结果表明这种间接方法留下了根本性的空白。可能需要直接的感知预训练或专门的视觉编码器模块来弥合这一差距。
研究界的反应是谨慎的兴趣。预印本渠道上的初步讨论强调了方法的彻底性和测试模型的广度。一位评论者称该论文是任何从事下一代多模态系统工作者的必读之作,同时指出该基准设计在更广泛采用之前值得仔细审视。
PerceptionBench并不声称解决任何感知问题。它提供了一种测量方法。对于多模态模型开发团队,该基准提供了一套诊断工具,能够揭示推理基准忽略的盲点。含义很清楚:在修复模型无法思考的问题之前,研究人员需要知道它看不到什么。完整的数据集和评估代码随预印本一起提供,允许其他团队使用相同的粒度测试运行自己的模型。
- 来源 : Frontier AI vision models fail at basic perception, new benchmark shows — 2026-07-29
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。