SevenTnewS

AI 研究

VideoCoCo 通过在 Blender 代码中思考,修复 AI 视频错乱的物理

VideoCoCo 将可执行的 Blender 代码视为思维链:编码代理编写场景脚本,模拟器将其演绎出来,视频引擎让结果达到照片级逼真。这种分工针对文生视频的物理问题,并在 PhyGenBench 和 VBench-2.0 上取得了最佳平均分。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-30 · 最后更新:2026-08-02 · 阅读需 4 分钟

VideoCoCo 通过在 Blender 代码中思考,修复 AI 视频错乱的物理

把一段文生视频看得足够久,你就会发现破绽。杯子倾倒、布料折叠、球体弹跳, , 然后在第三秒前后的某个时刻,像素不再遵循物理规律。画面几乎以假乱真,动态却常常不是那么回事。最新一轮基准数字背后的论文认为,这不是渲染问题,而是推理问题。

VideoCoCo 于 7 月 29 日以计算机视觉与模式识别(Computer Vision and Pattern Recognition)分类提交至 arXiv,其出发点是一个具体的诊断。文生视频模型必须从高度压缩的文本提示中隐式地推断场景的时间演化,而物理一致性正是在这种隐式推断中消亡的。论文还解释了为什么此前的思维链尝试没能解决这个问题。它们生成的中间计划和视觉状态通常是不可执行的,或者在时间上是稀疏的。模型可以示意应该发生什么,但没有任何东西去执行它。

让思维链可执行

VideoCoCo 是一个智能体双引擎框架,只有弄清楚每个部分各自负责什么,这个设计才有意义。编码代理接收提示词,合成一个 Blender 程序,明确指定场景及其随时间的演化。一个可执行的模拟引擎运行该程序,生成确定性的时空草稿, , 在绘制任何像素之前,先解析出一个具体的运动版本。然后,生成式视频引擎通过以草稿为条件的编辑,将草稿转化为照片级逼真的片段。编码代理不是用文字描述场景然后寄望于奇迹发生,而是编写一个程序,声明什么存在、什么在变化。

关键在于这种分解。过程层面的推理, , 决定场景如何表现, , 存在于可执行代码中,可以像任何程序一样被运行、检查和修正。高保真的视觉呈现, , 让它看起来像电影, , 则交给生成式引擎。每一半都不必擅长另一半的工作。生成式引擎不再需要从像素中凭空发明物理,它只需要让一段忠实的模拟看起来像电影, , 这是一个更狭窄、也更容易处理的任务。

为了让视频引擎适应模拟输入,研究人员构建了 VideoCoCo-3K,这是一个经筛选的草稿-指令-目标三元组数据集,用于让编辑器适配模拟器生成的草稿。该条目目前在 Hugging Face 上显示有 64 个点赞。

解读分数榜

接下来是数字。在 PhyGenBench 上,VideoCoCo 将 OmniWeaving 基线从 0.475 提升至 0.558。在 VBench-2.0 上,它从 52.18 跃升至 77.88,提升了 25.7 分,论文报告称它在两个基准上都取得了最佳平均分。

基准OmniWeaving 基线VideoCoCo
PhyGenBench0.4750.558
VBench-2.052.1877.88

这些分数位于不同的刻度上:PhyGenBench 以小数计,VBench-2.0 以分值计,因此这两处提升不应直接比较。基准数字在固化成头条之前,也值得加一个脚注:这些测试套件检验的是定义明确的行为切片,而结果只是一个团队从自身评估中得到的数字,还有待独立复现。但跃升在两套基准上都出现了,这并非毫无意义。它让核心主张有了被认真对待的空间。

结构性的押注比分数更有意思。如果由模拟器来解决物理问题,AI 视频的实际失效模式就会改变。你得到的不是一个无法理解世界的模型,而是一个可以调试的草稿。相同的提示词会产生相同的模拟,编辑 Blender 脚本则成为引导结果的一种方式。确定且可检查,对文生视频而言是一个真正不同的运行点。

摘要留下的空白

有三个空白值得指出。该流水线在生成之前插入了一个完整的模拟阶段,而摘要对它在算力或延迟上的代价只字未提。Blender 草稿是确定性的几何形态,而基于这些草稿训练的视频引擎是否仍能实现富有表现力或风格化的运动,尚未得到证实。而且,这些结果来自一个团队、两个基准,尚无独立验证。大多数优秀结果都是这样起步的。

VideoCoCo 的赌注在于:AI 视频的一致性来自一整套 3D 流程,而不是更大胆的提示词。在它自己的基准上,这个赌注得到了回报。在基准之外它是否依然成立,要由复现来回答,而这正是值得关注的问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。