SevenTnewS

开源AI

英伟达AV-Flamingo:攻克长视频理解,碾压多数模型

英伟达发布AV-Flamingo,一款专为长视频、复杂视频理解设计的开源音视频大语言模型。它采用三阶段课程学习法和带时间戳的思维链框架,能够处理许多模型难以应对的时间推理与跨模态推理任务。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-28 · 阅读需 5 分钟

英伟达AV-Flamingo:攻克长视频理解,碾压多数模型
来源 : Audio-Visual Fl…

视频理解只是看上去是个已解决的问题, , 前提是所说的视频只是一段5秒钟的滑雪猫短片。一旦要求模型跟踪一段10分钟会议录音中的对话,或者拼凑出长达几分钟的监控录像中发生的事件,大多数现有系统就不再有效。

英伟达与来自多家机构的研究人员合作,发布了AV-Flamingo,一款完全开源的音视频大语言模型,采用了不同的思路。该模型并非针对占据大多数基准测试的短视频进行优化,而是从头开始为长视频、复杂、真实世界的视频构建,这些视频结合了音频、视觉和时间结构。

长视频难在何处

长视频的核心问题在于它放大了大语言模型的所有弱点。视觉信息以高帧率到达。音轨包含重叠的语音、环境噪音和静音。而问题所关心的内容, , 某个特定动作、某人语气的变化、背景中出现的物体, , 可能发生在第3秒,直到第47秒才被解决。在短视频上表现良好的模型,往往在30秒后就会丢失线索,因为它们的注意力机制没有经过跨越这么长的时间训练。

AV-Flamingo通过三个主要贡献解决了这一问题,相关研究论文发表在arXiv上,并从项目的Hugging Face页面链接。

为推理而非识别构建的数据集

图:AV-Flamingo基准测试表现与其它模型对比
根据文章,AV-Flamingo在与类似规模模型的对比中,在长视频和全模态基准测试上领先或表现强劲。

首先是Audio-Visual-Skills,一个大规模数据集,包含约700万个从真实世界视频中提取的标题和问答训练实例。该数据集旨在强制进行时间推理、组合推理和跨模态推理, , 也就是模型需要将某处听到的内容与另一处看到的内容联系起来的任务类型。它有意区别于许多将每一帧视为大致独立、主要测试对象识别的视频数据集。

三阶段课程训练

第二个贡献是三阶段课程学习,逐步增加模型处理内容的复杂性。阶段一专注于短程感知,在短时间跨度内对齐音频和视觉信号。阶段二过渡到具有简单事件边界的片段。阶段三推进到长时间跨度的多事件推理,模型必须跟踪跨越数分钟素材的整个叙事线索。

这种分阶段方法很重要,因为直接用随机初始化跳入长视频会导致输出不连贯。模型先学会走再学会跑,研究论文表明每个阶段都能显著提升下一阶段的性能。

带时间戳的思维链

第三个部分是时间音频视觉交错思维链,一种推理框架,强制模型将其中间推理步骤锚定到特定的时间戳。模型不是基于所看所听的模糊混合直接给出最终答案,而是必须有效地说:在第12秒我听到了这个,在第14秒我看到了那个,因此答案是这个。

这使得模型的输出更易于解释,并且根据论文,它提高了时间对齐能力, , 当模型必须沿途中承诺时间戳时,它不太可能混淆发生在不同时间的事件。

与开源和闭源模型的基准测试结果

基准测试类型AV-Flamingo(开源,可比较规模)最佳可比开源模型更大开源/闭源模型
音视频理解(长视频)领先或具有竞争力明显落后具有竞争力,有时超越
全模态基准测试强劲相似具有竞争力
纯音频任务强劲相似具有竞争力
纯视觉任务扎实可比较部分落后

在涵盖音视频、全模态、音频和视觉任务的超过15个基准测试中,AV-Flamingo以明显优势优于类似规模的开源模型。面对包括闭源模型在内的更大模型,它也毫不逊色,尤其是在其设计的长期复杂视频理解任务上。论文并未将其呈现为每个基准测试的最佳模型, , 一些专门的系统在狭窄的纯视觉测试上仍领先, , 但在音视频理解和长视频时间推理的组合上,它在开源权重模型中树立了新的标杆。

现实世界应用差距

基准测试分数只说明了部分问题。论文强调,AV-Flamingo能很好地迁移到未见过的任务,并展现出强大的现实世界实用性。这是一个更难量化的说法,但至关重要:许多在受限基准测试中表现出色的模型,当面对杂乱无章、未经剪辑的视频、变化的音频质量、意外剪辑和背景噪音时,就会崩溃。AV-Flamingo在真实世界素材而非精选片段上的训练是这里的关键区别。

开源权重、开源数据集、开源未来

英伟达在Hugging Face上以项目命名空间nvidia/av-skills发布了模型权重、Audio-Visual-Skills数据集和代码。研究人员可以重现结果,用自己的数据进行微调,或基于三阶段课程学习解决相关问题。

此次发布是英伟达在闭源产品线之外发布强大开源模型的更广泛模式的一部分,并对那些将其最佳视频理解模型封存在API或付费墙后面的实验室施加了压力。对于需要分析带有音频的长视频的从业者, , 会议记录、讲座档案、安全视频、纪录片集, , AV-Flamingo现在是可用的最可行的完全开源选项。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。