SevenTnewS

基准测试

你的智能眼镜记得一切,但无法告诉你事件发生的时间

Meta 的 S-EMBER 基准测试将 9,448 小时的以自我为中心的视频投入前沿 AI 模型,发现了一个定位悖论:语义推理随算力提升而扩展,但时间定位能力却没有。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 3 分钟

你的智能眼镜记得一切,但无法告诉你事件发生的时间
来源 : S-EMBER: A Larg…

可穿戴 AI 正进入流式处理阶段。智能眼镜现在持续录制,其卖点是助手能够准确回忆发生了什么以及何时发生。但一项新的大规模基准测试表明,“何时”部分存在缺陷,可能需要一种根本不同的方法来解决。

Meta 的研究人员,包括第一作者 Hoang Phan 和一个覆盖公司 AI 实验室的团队,本周发布了 S-EMBER(用于情景检索的流式自我中心记忆基准测试)。该基准测试包含 3,141 个视频,总时长 388 小时,这些视频通过 Ray-Ban Meta 智能眼镜拍摄的有机活动,并配有 9,448 个问答对,这些问答对需要精确的时间定位来提供手动视觉证明。

关键的设计选择是 S-EMBER 作为流式基准测试运行,而不是离线基准测试。当前的视频理解评估通常将整个文件输入模型并让其回答问题。S-EMBER 则模拟可穿戴设备的真实世界条件,其中新帧因果性地到达,检索由流中的事件触发,而不是由人类暂停和搜索触发。

定位悖论

图表:语义推理与时间定位
文章指出,语义推理随模型规模提升而改善,但时间定位能力保持不变,无论参数、输入分辨率或每秒帧数如何。未提供确切的性能数据。

该论文的核心发现是作者所称的“定位悖论”。我阅读了完整的结果表格以理解他们的意思,数字令人震惊。在 GPT-4o、Gemini 2.0 Flash 和 Llama 3.2 等模型中,研究人员分别测量了两种能力:语义推理(识别问题描述的对象或事件)和时间定位(精确指出事件出现的时间戳)。

语义推理随模型规模提升而改善。更大的模型更善于回答“是的,这个人拿起了一个蓝色杯子。”但时间定位精度保持不变,无论你扩大参数、增加输入分辨率,还是每秒输入更多帧。一个 80 亿参数的模型与 4050 亿参数的模型在时间戳事件的准确性上大致相当,在测量的统计噪声范围内。

这很关键,因为一个能够告诉你“你确实与那份文件有互动”但无法说“那大约是在周二下午 3 点”的可穿戴助手对于情景记忆检索几乎没有实际价值。

论文具体指出了瓶颈所在。问题不在于编码单个帧,而在于时间聚合机制。模型能够识别包含相关事件的帧,但在将帧拼接成叙述时丢失了位置信号。使 transformer 擅长理解场景要旨的相同架构模式,也使它们不善于保留该场景在 30 分钟流中的确切位置。

基准测试衡量的不同之处

现有的以自我为中心的视频基准测试,如 Ego4D 的情景记忆任务,在离线、搜索导向的设定了评估模型。代理一次性看到整个视频和所有问题。S-EMBER 则形式化了“基于流式的定位情景检索”,其中模型处理连续流,并且必须回答由视觉事件触发的问题,而无需重新扫描整个过去。

这更接近人类在观看视频时有人问“你看到那辆红色汽车经过了吗?”的情况。答案取决于事件是否被注意到,而不是模型能否通过全面搜索在事后找到它。

该基准测试还支持灵活的回答长度,以模拟自然的人机交互。正确的答案可能是精确的时间戳或叙述性描述,评估会考虑两者。

Meta 已将数据集作为 facebook/S-EMBER 发布在 Hugging Face 上,但目前没有模型引用使用它,可能是因为该基准测试才发布几天。

Meta 的 S-EMBER 基准测试表明,视频模型中的语义推理随着规模提升而持续改进,但时间定位已经停滞。这对任何承诺从长时间视频流中检索特定记忆的可穿戴 AI 都有直接影响。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。