SevenTnewS

计算机视觉、世界模型与AI研究

PhiZero:在渲染前教视频AI用物理规律思考

PhiZero是CASIA的世界模型,它从原始视频中学习一种紧凑的离散“物理语言”,并在渲染帧之前用这种语言推理场景将如何演变。作者认为,这种先推理后渲染的设计比直接预测像素能产生物理上更一致的视频。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 最后更新:2026-08-02 · 阅读需 4 分钟

PhiZero:在渲染前教视频AI用物理规律思考

视频生成模型有一个物理难题。给它一个起始帧,它可以生成一个完全合理的序列,其中球向上落、杯子穿过桌子、手臂以错误的方式弯曲。CASIA的新论文认为,缺陷是结构性的:当今的模型直接预测像素,而这一流程中没有任何环节表达所描绘世界的规则。

提出的解决方案并不寻常。PhiZero并不试图让视觉预测器更聪明。相反,它完全离开像素层面,首先将场景的预期演变转化为作者所称的“物理语言”, , 一种世界状态转换的紧凑离散表示,然后将该描述渲染为视频。先推理,后绘制。

直接预测像素的问题

论文指出,现有的物理世界模型通常在像素空间中运作:它们获取一帧或一个提示,然后预测未来帧,正如摘要所说,将“底层世界动态隐含在高维视觉预测器中”。这对短小、炫酷的片段有效。但对于需要一致力学机制的场景,它显然不够有效,因为模型从未被要求暴露它认为正在发生什么,而只需暴露它认为看起来像什么。

PhiZero的前提是,人类做的事情有所不同。我们从视觉经验中抽象出预测结构,并将其组织成大致类似语言的关于事物如何变化的陈述。论文将这一观察视为设计约束,而非哲学问题。

Schéma : PhiZero reason-then-render pipeline
该流程遵循论文的先推理后渲染设计:PhiZero从无标注视频中学习离散的物理语言,以该语言推断未来的世界状态转换,然后才渲染视频帧。

在真实场景中学到的物理语言

这种“语言”并非手工构建的本体。PhiZero通过自监督从未经标注的真实世界视频中学习它,作为一种状态变化的紧凑离散表示,不需要标签或注释。摘要没有详细说明该语言中一个单元究竟编码什么。意图足够清楚:在允许模型绘制任何内容之前,迫使它对将要发生的变化作出描述。

先推理,再渲染

该架构遵循作者所称的“先推理后渲染”两阶段范式。第一阶段将世界的未来演变推断为物理语言中的序列。第二阶段将这些推断出的转换渲染为实际视频帧。这种分工正是PhiZero与那些将动态烘焙进高维预测器并希望其在推理时重新浮现的方法的区别所在。

论文的主张

作者报告了在生成和理解基准上的大量实验,用摘要的话说,验证了“物理一致的世界演化”。他们还声称在三件超越基准分数的事情上有潜力:现实且交互式的世界建模、细粒度的动作条件模拟,以及零样本运动迁移, , 即在一个物体上学到的运动模式可以在不重新训练的情况下应用到另一个物体上。

该预印本于2026年7月30日提交至arXiv,项目页面可在phi-zero.github.io查看。截至本文写作时,该论文在Hugging Face上获得了155个赞。这只是适度的社区关注,并非对该科学成果的评判。

悬而未决的问题

这些开放问题是真实存在的,论文也邀请人们提出这些问题。在基准测试中,“一致”在操作层面意味着什么?当场景变得漫长而拥挤时,离散表示如何扩展?还有,“语言”是恰当的比喻,还是一个冠以美名的复杂离散瓶颈?摘要并未解决其中任何一点。更强的主张, , 显式推理优于直接像素预测, , 需要第三方基准测试,以及在别人的数据上复现“先推理后渲染”流程,才能真正有意义。

这些都不会让这一方向失去吸引力。世界模型正同时被两种力量拉扯:要么走向更大的上下文和更长的预测视野,要么走向更结构化的内部表示。PhiZero押注于后者:一个能在展示将要发生的事情之前说出将要发生什么的模型,最终会比一个仅仅渲染它的模型更好地理解世界。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。