SevenTnewS

视频生成

7 published articles

视觉与扩散4 min read

计算机视觉、世界模型与AI研究

PhiZero:在渲染前教视频AI用物理规律思考

PhiZero是CASIA的世界模型,它从原始视频中学习一种紧凑的离散“物理语言”,并在渲染帧之前用这种语言推理场景将如何演变。作者认为,这种先推理后渲染的设计比直接预测像素能产生物理上更一致的视频。

2026-07-31

NVIDIA Research3 min read

AI研究

视频生成速度提升120倍:英伟达混合注意力机制突破单GPU极限

英伟达研究院的SANA-Video 2.0以3:1比例结合线性注意力和周期性softmax注意力,在单块H100上比Wan 2.2快120倍。混合设计恢复了全秩表达能力,同时将720p片段的推理时间控制在13秒。注意事项:基准测试止步于720p,且注意力改变与专有优化捆绑。

2026-07-31

视觉与扩散4 min read

AI 研究

VideoCoCo 通过在 Blender 代码中思考,修复 AI 视频错乱的物理

VideoCoCo 将可执行的 Blender 代码视为思维链:编码代理编写场景脚本,模拟器将其演绎出来,视频引擎让结果达到照片级逼真。这种分工针对文生视频的物理问题,并在 PhyGenBench 和 VBench-2.0 上取得了最佳平均分。

2026-07-30

人工智能4 min read

视频生成

MiniMax H3 价格低于视频竞争对手,并计划开放权重

MiniMax 将图像、视频和音频生成整合到一个模型中,输出每秒定价低于主流费率的三分之一,并计划数日内开放权重。在其自家演示之外,输出效果究竟如何仍是个悬而未决的问题。

2026-07-30

实验室Featured3 min read

人工智能研究

Kling发布两项基准测试,揭示生成式视频真实水平之低

Kling团队推出MultiRef-Compass和KeyFrame-Compass,这两项基准测试将视频生成模型从文本到视频的任务,拓展到多参考和关键帧条件任务。对八个和九个系统的早期测试显示,在实体绑定、时序保持和密集约束处理方面持续失败。

2026-07-26

人工智能Featured1 min read

视频生成与游戏引擎

游戏引擎能教会AI什么:保持其世界一致性

视频生成模型常被称为下一代游戏引擎。但如果没有稳固的状态追踪,它们会忘记两帧前发生了什么。一篇新论文剖析了这个问题,并提供了超过90小时的《黑神话:悟空》游戏数据集作为解决该问题的资源。

2026-07-23

人工智能Featured3 min read

人工智能

MiniMax 产品大爆发:代码、音乐、视频新模型全面升级

中国 AI 初创公司 MiniMax 推出 MiniMax M3、Hailuo 2.3、MiniMax Code 以及新的语音/音乐模型,在竞争激烈的市场中拓宽了产品线。

2026-07-06