视频理解
Gemini 3.6 Flash 能数清状态变化,却漏掉眨眼
一项新的 arXiv 研究表明,视频语言模型在简单的事件记录任务上表现失败。Gemini 3.6 Flash 最多可正确计数 12 个持续性状态变化事件,但对瞬时眨眼没有可靠的计数区间;额外帧推高了准确率,却无法实现忠实的恢复,高计数场景下最终计数正确的比例仅为 0.2%。

一篇于 8 月 6 日发布在 arXiv 上的论文指出,视频语言模型在简单的事件记录任务上表现失败,而标准基准测试掩盖了问题的严重程度。《低频陷阱:视频语言模型在简单事件记录上的失败》("The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping")使用基于轨迹的参数剖析方法测试了 Gemini 3.6 Flash,这种方法审计模型报告的事件,而不是仅对最终答案评分。
事件表示决定模型能否看到任何东西
研究人员构建了三个受控视频任务:弹球碰墙、视觉眨眼和类别状态转换。在 2,190 个视频中,他们在保持渲染不变的情况下改变事件数量和频率,每个片段都附带可执行的事件轨迹,因此可以在时间戳级别将预测与真实标注进行核对。
这种失败是分阶段的。在 80% 可靠性阈值下,Gemini 3.6 Flash 在 0.5 和 1.0 Hz 下能正确计数最多 12 个持续性状态转换事件。瞬时眨眼事件从未达到可靠的正计数区间。用作者的话说,事件表示决定了模型最初能否获取证据,而这种局限会随着数量和频率的增加而加剧。
受测模型是生产级产品,而非实验室里的新奇事物。谷歌于 7 月将 Gemini 3.6 Flash 加入其产品线,它是三模型批次中更便宜、更高效的选择,该批次还包括更快的 Lite 版本和一款经过审查的网络变体。谷歌的 Gemini API 文档称,这些模型可以处理视频并从中提取信息。计数眨眼正是这种描述所暗示的那类简单任务。
额外帧推高分数,却无法恢复事件
论文中最尖锐的数字是准确性与忠实性之间的差距。提高采样率将 Bounce Ball 准确率从 19.6% 提升至 29.3%,但报告的事件序列与真实标注的一致率仅为 3.7%。作者得出结论:额外帧可以推高最终分数,却无法产生忠实的事件恢复。
高数量、高频率的条件看起来更糟:最终计数正确的比例仅为 0.2%,模型只恢复了 18.1% 的真实事件。此前的时序定位测试发现了同样的瓶颈:无论你扩大参数、提高输入分辨率,还是增加每秒帧数,精确度都保持平稳。稀疏采样意味着事件可能根本不存在于模型的输入中。
| 条件 | 结果 |
|---|---|
| 80% 可靠性下的持续性状态转换 | 在 0.5 至 1.0 Hz 下最多计数 12 个事件 |
| 瞬时眨眼 | 没有可靠的正计数区间 |
| 增加帧数后的 Bounce Ball 准确率 | 19.6% 至 29.3% |
| 报告序列与真实标注一致 | 3.7% |
| 高数量条件下最终计数正确 | 0.2% |
| 高数量条件下恢复的真实事件 | 18.1% |
最终答案基准测试让模型得以隐藏失败
现有的程序化基准测试只对最终答案评分,因此一个得出貌似合理数字的模型,无论实际漏掉了多少片段内容,看起来都表现称职。这篇论文的贡献在于提供了一种基于轨迹的替代方案:每个视频都附带可执行轨迹,从而支持时间戳级别的评估和能力边界估算。
这种区别是实用性的,而非学术性的。视频基准测试结果取决于媒体预处理和帧选择,因此这些流水线选择在模型看到任何内容之前就决定了一部分分数。作者还尝试了不同的提示策略,发现收益同样有限,这指向模型如何表示瞬时事件的问题,而非问题的表述方式。
真实世界视频表现出同样的低计数上限
受控结果同样适用于自然素材:真实世界视频评估显示,成功同样集中在低事件数量区间,而这正是模型看起来可用的场景。任何需要统计简短、离散事件数量的应用,都处在这个上限的错误一侧。
这里存在一个架构上的讽刺。持续视频项目(如 Om AI Lab 在 Hugging Face 博客文章中介绍的 VLX-Flow)指出,大多数视频模型只有在用户提出问题后才会开始观看,而真实设备等不了那么久。如果事件表示是瓶颈,那么仅靠持续观看并不能解决事件记录问题。论文的结论是方法论层面的:基于轨迹的剖析将视频评估从聚合准确率转向对时序推理失败位置的诊断。对于任何部署视频模型的人来说,一个看起来不错的分数与一条匹配的轨迹之间的差异,才是关键所在。
- 来源 : Gemini 3.6 Flash counts state changes but misses blinks — 2026-08-06
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。