SevenTnewSAI 与科技新闻,深度解读

流式视频异常检测研究

ReactVAU 仅在视频流出现可疑情况时唤醒其最重的模型

ReactVAU 将流式视频异常检测拆分为一个始终开启的低成本过滤器和一个昂贵的推理器,后者在出现异常之前一直休眠。论文声称可大幅节省算力,却没有公布任何数据来支撑这一说法。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-18 · 阅读需 4 分钟

ReactVAU 仅在视频流出现可疑情况时唤醒其最重的模型

离线采样与记忆压缩都无法应对实时视频流

一台对准空荡走廊的监控摄像头连续拍摄六小时,产出的是六小时的“什么都没有”。一个对全部画面运行多模态大语言模型的视频异常系统,几乎会把整个推理预算都花在描述这些“什么都没有”上。新近发布的一篇关于流式视频异常理解的论文 ReactVAU 认为,解决方案是一个调度问题:在出现值得推理的内容之前,昂贵的推理不应该运行。

视频异常理解要求系统检测出异常事件并加以解释,这比单纯标记一个时间戳要繁重得多。ReactVAU 的摘要将该领域描述为困在两种设计之间,而这两种设计在实时场景下都会失效。离线方法对一段视频进行全局采样并一次性整体推理,作者称这种做法违反因果性,无法部署于实时流。流式视频模型保持了因果顺序,但在压缩记忆的过程中会稀释罕见、短暂的异常,而且无论是否发生事件,它们往往都按固定时间表启动重型模型。

ReactVAU 将这两项工作拆分为两条路径:一条永不停歇的快路径,和一条大部分时间都在休眠的慢路径。

快速过滤器、慢速推理器、持久记忆

第一块是基于空间网格折叠(Spatial Grid Folding,SGF)构建的轻量级快速检测模块(Fast Detection Module)。它持续运行,在不调用大型模型的情况下,为视频流过滤出任何看起来不对劲的内容。第三块是重量级的慢速推理模块(Slow Reasoning Module),负责语义验证与因果描述,也就是解释所看到的内容。它在正常画面期间保持休眠,仅在快速模块标记出可疑事件时才被唤醒。

组件任务运行时机
快速检测模块(空间网格折叠)持续异常过滤始终运行
异常感知持久记忆防止关键视觉线索随时间衰减始终运行
慢速推理模块语义验证与因果描述仅在标记出事件时

两者之间是异常感知持久记忆(Anomaly-Aware Persistent Memory,AAPM),它能在视频流压缩自身历史的过程中,让重要的视觉细节不至于消退。这正是论文所批评的流式模型容易丢失短暂事件的地方:等到重型模型去看的时候,线索早已被平均进背景之中。AAPM 是论文为留住这些线索所做的尝试。

这一目标在生产级 AI 中并不陌生。运行大型模型要花钱,而把它用在并不需要的数据上,是浪费这笔钱最直接的方式。

实时监控是这种预算算计的一个不寻常的应用场景。视频流永不停歇,值得关注的时刻稀少而短暂,而一个只能在事件发生很久之后才做出解释的系统,对正在看画面的人来说用处不大。ReactVAU 的赌注是:昂贵的计算应当由罕见事件触发,其余一切都可以交给一个小东西来处理。

效率主张没有附带任何数字

论文称,在“多个基准”上的实验表明,ReactVAU 能在流式约束下运行,并在异常检测与因果推理方面保持竞争力,同时因更少调用重型模型而获得“显著提升的计算效率”。摘要未给出任何具体数字。没有每秒帧数,没有准确率数值,没有延迟数据,也没有列出作者使用了哪些基准。

对摘要而言这很正常,但它让效率主张停留在承诺层面,而非读者可以核验的测量结果。项目主页 huiyuiui.github.io/React_VAU/ 应是存放佐证材料的地方。

该架构的风险还集中在便宜的那一半上。如果快速模块漏掉了一个短暂异常,慢速模块就永远不会被唤醒,系统会报告这是一段正常视频流。过滤器的漏检频率有多高,记忆在数小时而非数分钟的时间尺度上表现如何,这些问题决定了休眠式模型设计是真正的节省,还是一张延期支付的账单。而一篇只承诺效率却不附带任何数字的摘要,对这些问题都没有回答。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。