AI 视频生成
阿里巴巴 Wan3.0 按秒出售视频:30秒片段6美元
Wan3.0 可以将 PDF 或品牌演示文稿在一次生成中变成 30 秒视频,API 按秒计费,1080P 最高每秒 0.20 美元。我们拆解了每段视频的成本,以及阿里巴巴在自测中承认的不足。

阿里巴巴的Wan3.0是 Wan 视频模型系列的最新版本,现已在阿里云 Model Studio 上线,采用按秒计费:480P 每秒 0.05 美元,720P 每秒 0.10 美元,1080P 每秒 0.20 美元。一次完整的 30 秒生成,在最高档位需 6 美元,作为 480P 草稿则为 1.50 美元。这些数字本身不如它们带来的可能性重要:先用廉价草稿迭代,再为最终成片支付更高费用。
按秒计费让重拍成为预算项目
大多数 AI 视频模型只能生成几秒钟的片段,用阿里巴巴的话说,这足够一个镜头,但不足以讲述一个故事。Wan3.0 将单次生成时长扩展到 30 秒,并具备智能时长功能,可根据提示词推荐时长,还提供视频续写选项,可在初始生成之后继续生成。更长的输出改变了创作语汇:为叙事节奏、连续运镜和一镜到底的段落留出了空间。
按秒计费是经济效益具体化的关键。480P 下,一段 30 秒草稿需 1.50 美元,足以支撑粗略迭代。完成同样长度 1080P 成片,每次尝试需 6 美元。阿里巴巴自己的示例也采用同样的算法:在 480P 下迭代,在 1080P 下完成。
| 分辨率 | 每秒价格 | 30秒片段 |
|---|---|---|
| 480P | $0.05 | $1.50 |
| 720P | $0.10 | $3.00 |
| 1080P | $0.20 | $6.00 |
有两件事仍未解决。产品说明没有说明失败或丢弃的生成是否仍会计费,而且它列出了四种创作模式(reference、editing、replication、driving),却没有定义它们的区别。产品说明还将并发任务数限制为两个,这意味着重做版会在正在运行的任务之后排队。对于追求角色一致性的团队来说,按秒计费至少让每次失败都可预测:每次重做 6 美元。
文档进,品牌片出
更大的功能变化在于输入。Wan3.0 是 Wan 系列中首款将文档作为结构化输入读取的模型:doc、xls、ppt、pdf、txt、key、pages、numbers 和 md,每个请求最多一个文件或链接,限制为 100MB 和 50 页。将文档与提示词配对,提示词就充当控制中心,负责解读输入并塑造输出。阿里巴巴的演示是一份咖啡馆品牌介绍文档,加上一句指令:“把这个品牌故事变成一支暖色调的品牌 TVC”,从而生成一支完整的品牌影片。
阿里巴巴的框架是,视频生成正在从内容新奇感转向生产工具。万物转视频(everything-to-video)能力瞄准广告、UI 交互演示和目的地营销,在这些场景中,目的地影片不再需要大规模外景拍摄。在阿里巴巴看来,同样的路径也覆盖软件功能动画和数据可视化:模型保留原始设计的美感和质感,同时将其提升为动态画面。API 本身并不能决定这些用例是否划算,但输入的灵活性让现有演示文稿可以变成草稿视频,而无需从头重建创意。
真实感宣称,以及阿里巴巴承认的差距
在输出质量方面,Wan3.0 依赖两项主张:逼真、多样化的面孔,而非典型 AI 角色那种光滑、可互换的外观;以及角色、道具、空间和风格之间精准的参照转视频一致性,包括群像场景中各异的情感。Wan2.7 引入的编辑能力得到延续,因此无需从头重新生成,即可修改画面、情节和对话。迭代变成一次修改校对,而不是推翻重做。
该博客认为,一致性是制作团队最关心的指标:在参照转视频模式下,Wan3.0 能精确复现参照细节,并在关键维度上保持稳定。这就是单独看没问题、放到剪辑序列中也能立住的片段之间的区别。
阿里巴巴也指出了模型自身的不足。在内部测试中,音频质感和屏幕文字渲染的准确性“正在改善,但尚未达到我们想要的水平”,两者都是正在积极优化的领域。对于一个将文档和图表作为输入的模型来说,屏幕文字清晰可读是一个不容忽视的差距。
发展轨迹显而易见:Wan 系列已经从 Wan1.0 迭代到 Wan3.0,共发布了八个版本。阿里巴巴将这些能力, , 理解更丰富的信息、生成物理一致性更强的输出, , 指向具身智能、自动驾驶和工业仿真。就目前而言,务实的解读更简单:按秒计费让 AI 视频支出变得可预测。6 美元能否买到一条可用的片段,只有实际制作才能回答。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。