SevenTnewS

人工智能研究

Kling发布两项基准测试,揭示生成式视频真实水平之低

Kling团队推出MultiRef-Compass和KeyFrame-Compass,这两项基准测试将视频生成模型从文本到视频的任务,拓展到多参考和关键帧条件任务。对八个和九个系统的早期测试显示,在实体绑定、时序保持和密集约束处理方面持续失败。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-26 · 阅读需 3 分钟

Kling发布两项基准测试,揭示生成式视频真实水平之低
来源 : MultiRef-Compas…·KeyFrame-Compas…

视频生成基准测试大多只测试一件事:模型如何将一个句子转化为一段视频。Kling团队在同一天发布的两篇新论文,转而研究更困难的问题。

第一篇,MultiRef-Compass,聚焦于作者称之为多参考到音频视频生成(MR2AV)的任务。模型并非只获得一个文本提示,而是获得多张参考图像及其说明,并必须生成同步的音频和视频,且尊重每个参考信息。该基准测试包含350个样本,涵盖多视角主体保留、多实体绑定以及人-物-场景组合。

对八个代表性MR2AV系统的测试显示,没有系统能够很好地处理该任务。论文定义了四个评估维度:基本质量、参考一致性、视听一致性和指令遵循,并包含14个子指标。模型在参考一致性和指令遵循方面得分一直最低,而这正是实际应用中最关键的维度。

图表:MR2AV系统在参考一致性和指令遵循方面得分最低
根据Kling团队的MultiRef-Compass基准测试,模型在四个评估维度中,参考一致性和指令遵循得分持续最低。

第二篇基准测试,KeyFrame-Compass,解决关键帧条件视频生成问题。创作者越来越多地使用故事板, , 一系列参考图像, , 来引导视频模型。该基准测试包含386个样本,涵盖三个应用领域、两种视频结构、两种提示粒度、两种条件格式和四种关键帧密度。

这里的关键发现是一种被证明是根本性的权衡:忠实执行关键帧的模型生成的视频自然度较低,而生成自然视频的模型则忽略关键帧。随着关键帧密度的增加,性能下降。大多数开源模型也无法将故事板网格输入解释为时间排序序列, , 模型将图像网格视为单个复合图像,而非时间线。

两项基准测试均使用了重新评判增强的MLLM作为评判者评估框架。这意味着评判本身由大型多模态模型完成,并经过第二次传递以捕获评分错误。这种方法具有可扩展性和可审计性,但也意味着这些基准测试依赖于与测试其他模型相同的技术。

Kling团队于2026年7月15日在arXiv上发布了这些基准测试。截至撰写本文时,这些论文在Hugging Face上分别获得了31和34个点赞,对于一个产出过高知名度视频模型的研究实验室来说,这算是适度的兴趣。这种反响可能反映出该领域的坏消息不如新演示那样易于传播。

这些结果与自第一个Sora演示以来一直可见的模式一致:受控评估揭示了精心挑选的促销片段所隐藏的失败。文本到视频的质量在过去两年中显著提高。多参考和关键帧条件生成并没有跟上。

对于任何在这些模型上构建生产管线的人来说,这些基准测试建议调整预期。一个能从单个提示生成令人印象深刻的一次性视频片段模型,当被要求保留角色在切换中的外观或遵循故事板的精确帧序列时,可能会生成垃圾内容。忠实度与自然性之间的权衡在当前这一代架构中不会消失。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。