AI研究
视频生成速度提升120倍:英伟达混合注意力机制突破单GPU极限
英伟达研究院的SANA-Video 2.0以3:1比例结合线性注意力和周期性softmax注意力,在单块H100上比Wan 2.2快120倍。混合设计恢复了全秩表达能力,同时将720p片段的推理时间控制在13秒。注意事项:基准测试止步于720p,且注意力改变与专有优化捆绑。

视频生成的成本始终在于注意力, , 不是那种按点击付费的注意力,而是扩散Transformer内部的自我注意力机制。每一帧都会增加更多token,而全softmax注意力让每个token与其他所有token相互关注。这种二次缩放将一段短片段变成了漫长的等待。
英伟达研究院的SANA-Video 2.0(2026年7月以预印本形式发布)试图解耦这一成本。它以3:1的比例混合线性注意力与周期性softmax步骤,论文声称对于5秒720p片段,在单块H100上运行速度比Wan 2.2-A14B快120倍。这个数字引人注目,但拆解后可以发现,为了弥合理论与实践之间的差距,投入了多少工程努力。
混合注意力机制
该架构通过用门控线性替代方案取代大多数softmax操作来避免二次惩罚。每四个注意力步骤保留一次softmax作为全秩锚点。其理念是纯线性注意力会因token间接交互而失去表现力。周期性softmax步骤恢复了直接交互。论文称其为混合线性-softmax注意力,它结合了用于O(N)混合的门控线性路径和3:1比例的周期性softmax锚点。
为了将这些刷新后的表示推过网络,块注意力残差(AttnRes)将完成的块摘要路由到后续层。论文报告深层有效秩提升约12%。模型从零开始训练以直接学习混合模式,避免了线性化预训练Transformer时可能发生的退化。
优化栈
在骨干网络之上,英伟达应用了其Sol-Engine优化栈,包括内核融合、缓存和稀疏注意力。论文称这一额外层将硬件友好的骨干网络进一步加速了3.58倍。将这两项改进叠加,使这个50亿参数的流水线在单块H100上生成720p、5秒片段仅需13.06秒。在720p和60秒条件下,编译后的DiT前向传递速度比匹配的全softmax基线快3.2倍,且差距随视频长度增加而扩大。
基准测试与对比
质量在VBench上衡量,SANA-Video 2.0在480p、40个采样步骤下得分为84.30,在单块H100上完成时间为13.2秒。作者称这与规模更大的全softmax视频DiT具有竞争力。在720p、5秒条件下,完整流水线比Wan 2.2-A14B快约120倍。差距随视频时长增加而扩大,这对长形式生成至关重要。
| 指标 | SANA-Video 2.0 (5B) |
|---|---|
| VBench得分 (480p, 40步) | 84.30 |
| 推理时间 (480p, 40步) | 单块H100上13.2秒 |
| 推理时间 (720p, 5秒, 完整流水线) | 单块H100上13.06秒 |
| DiT前向传递速度提升 vs 全softmax基线 (720p/60秒) | 3.2倍 |
| 速度提升 vs Wan 2.2-A14B (720p/5秒, 完整流水线) | 单块H100上120倍 |
待解问题与权衡
论文在480p和720p下测试至60秒,未探索1080p或更长序列。25%的softmax比例来自较低分辨率下的代理研究,尚不清楚该比例是否适用于更高分辨率或更长上下文。速度提升数字将注意力变化与Sol-Engine捆绑在一起,使得各组成部分的贡献难以分离。而与Wan 2.2(一个架构和训练不同的模型)的比较,也给120倍因子有多大程度可泛化到英伟达硬件之外留下了讨论空间。
这些不是致命缺陷,但对于评估该方法是否适合自身流水线的任何人而言,它们都是真实的注意事项。工程成就令人印象深刻,声明数据很大。但与任何预印本一样,细节比标题更重要。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。