SevenTnewS

AI 音乐生成

Music 3.0 用时间线取代单标签提示,让 AI 歌曲始终不跑偏

AI 曲目在展开过程中容易偏离提示:乐器退出、情绪平淡、人声风格时有时无。Music 3.0 用按时间顺序的 Structured Caption 取代单标签描述,并由 8B/0.6B Hybrid-LM 将结构与细节分开处理。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-21 · 阅读需 4 分钟

Music 3.0 用时间线取代单标签提示,让 AI 歌曲始终不跑偏

AI 生成的歌曲听起来可能很完整,却仍会背离要求:指定的乐器在第二段主歌时淡出,预设的情绪在桥段附近变得低落,人声风格再也没回来。整首歌听起来像一首完整的作品,只是不是任何人想要的那首。

这种失败模式正是 Qwen 音乐生成系列新款模型 Music 3.0 要解决的目标。它不再用一个覆盖整首曲目的全局标签,而是采用结构化字幕(Structured Caption):一种按时间顺序的描述,逐刻说明发生了什么、何时发生。

一个标签,然后开始跑偏

大多数文本转音乐系统会把请求压缩成对曲目的单一全局描述,这种描述在音乐展开前一直有效:乐器从编曲中消失,情绪变得平淡,人声演绎只出现在提示词恰好描述到的地方。Music 3.0 用结构化、按时间顺序的字幕取代这个单一标签。它仍然涵盖流派、BPM、拍号、调性、预期用途和制作质感。它还追踪情绪如何起伏、主奏和伴奏乐器何时进入或退出、律动和贝斯如何发展,以及演唱风格、和声和人声效果如何在各个段落之间变化。歌词中的段落标签,如 [intro]、[verse]、[pre-chorus]、[chorus]、[bridge] 和 [outro],提供了宏观结构;字幕则填充每个段落内部的变化。

同样的不满也塑造了该系列的前代模型。我们此前对 Qwen-Music 的报道指出,将旋律和编曲作为单一任务进行端到端生成的系统,最终会变得拥挤且漫无边际。Qwen-Music 先规划旋律。Music 3.0 将这一逻辑扩展到整个描述层。

Hybrid-LM 内部:8B 负责结构,0.6B 负责细节

在模型侧,Music 3.0 将工作拆分为两个网络。8B Global LLM 逐帧预测携带核心语义和结构内容的 token,同时牢记整首曲目的上下文。0.6B Local LLM 在每个帧内部工作,沿深度轴预测声学 token,以添加局部声音细节。

模型范围预测内容
8B Global LLM跨越整首曲目逐帧携带核心语义和结构的 token
0.6B Local LLM每个帧内部沿深度轴的声学 token,添加局部细节

这种分工让最长五分钟的歌曲保持时间稳定,同时保留各段落内部的多样性。它延续了 Qwen-Music 技术报告记录的设计:一个分词器将音频压缩为 25 Hz 的语义 token 流,一条旋律思维链在完整生成之前勾勒出粗略的人声轮廓。同样的原则:将规划与质感分开。

演示看起来像概念验证

该说明文档附带十余首演示歌曲,每首都采用新的字幕格式。一首温暖的华语流行抒情曲被描述为降 A 大调、74 BPM,温柔的怀旧情绪展开为欢快的副歌,成熟的男声男中音-男高音,细腻的古筝,柔和的弦乐,以及自然的现场空间声。情绪弧线、乐器、人声特质:都预先说明,而不是留待推测。

这种模式在各种流派中成立。"Cloud copy of me" 是一首关于将记忆上传到数据流的旋律性 EDM 作品,其字幕描述为:内省的段落逐步推进到令人振奋的、以钩子驱动的副歌,带有故障纹理和精良的节日混音。那首父母二重唱的华语流行情歌走得更远,指定歌手年龄在 50 到 70 岁左右,浓重的台湾口音,母亲领唱,父亲和声,编曲从钢琴和弦乐逐步扩展到鼓和电吉他,最后淡出到原声收尾。这些都不证明模型会忠实遵循这样的字幕;它只是展示该格式被设计用来捕捉什么。

段落级控制为制作人带来什么改变

对于给音乐模型写提示词的人来说,这改变了控制点。纠正跑偏通常意味着重新生成整首歌,或者重写全局提示词并寄希望于结果。一个以段落标签为锚点、明确指出何处发生什么变化的字幕,将"桥段中发生了什么"变成一个模型必须满足的条件。说明文档对目标直言不讳:让变化发生的位置成为显式生成条件。

竞争对手也在围绕同一个问题。MiniMax 将 Music 2.6 的发布包装为四位创作者的故事,而不是一串模型性能提升。Stability AI 已锁定与 UMG 和 WMG 的授权协议,现在必须兑现这些协议。Music 3.0 直指生产问题:连续五分钟生成所描述的那首歌。

说明文档没有说到的

没有任何评估数据显示 Music 3.0 对密集的时间字幕有多忠实;演示展示的是意图,而不是遵循度。Qwen-Music 的报告声称在客观指标和人类偏好上对 Suno V5 和 MiniMax Music 2.6 取得了最先进的结果,但字幕遵循是另一件评分标准不同的事。模型是否可靠地执行长序列的时间指令,以及字幕意图如何与歌词情绪相互作用,仍是开放问题。

开放权重同样如此。Qwen-Music 的报告没有承诺任何发布时程,尽管我们的报道指出 Qwen 家族的开源历史使得发布很有可能。Music 3.0 的资料对此只字未提。它会落在哪里,以及它能否很好地守住五分钟的指令,还没有人展示过。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。