SevenTnewS

AI研究

Qwen-music以旋律为中心,效果不言自明

Qwen-Music通过先明确规划旋律再生成完整歌曲的方式开辟新天地,该团队称之为Melody-CoT的方法。该模型在16项客观指标中的13项达到了最先进水平,并且在盲测中击败了Suno V5和MiniMax Music 2.6。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-20 · 阅读需 4 分钟

Qwen-music以旋律为中心,效果不言自明
来源 : Qwen-Music Tech…

阿里巴巴Qwen团队发布了Qwen-Music的技术报告,其中关于如何处理旋律的部分值得一读。核心理念:不要要求语言模型同时解决作曲和编曲问题。相反,让它先规划人声旋律,然后再填充其他部分。

该团队称之为Melody-CoT,即思维链。在生成完整的音乐token序列之前,模型会生成一组中间旋律token,描述一个粗略的人声轮廓。这不是精细的音高轨迹;它是一个低帧率(6.25 Hz)的表示,保留旋律的形状,同时去除颤音、装饰音和其他表演层面的细节。然后模型基于该规划生成歌曲的其余部分。

Melody-CoT还作为翻唱歌曲生成的接口。对于翻唱,参考旋律token从源音频文件中提取,并插入到提示前缀中,与目标风格标签和歌词一起使用。然后模型生成新的token,这些token遵循参考轮廓,同时允许音色、编曲和风格发生变化。

图表:Qwen-Music在盲测A/B对比中与竞品的胜率
文章中报告了Qwen-Music在由专业人类评审进行的盲测A/B偏好测试中与竞争系统的胜率。

将作曲与渲染分开贯穿整个架构。该系统使用三个主要组件:一个将音频压缩为25 Hz语义token的tokenizer、一个生成这些token的30亿参数语言模型(从Qwen3.5-Omni初始化),以及一个通过扩散和频谱精炼将离散token序列转换回48 kHz立体声波形的渲染器。这种设计意味着语言模型永远不需要担心相位相干性或高频细节。它在压缩的语义空间中工作,而渲染器负责声学保真度。

训练数据有助于解释这些结果。Qwen-Music-LLM在超过500万小时的多语言音乐数据上训练,涵盖数百种语言。这是大量的音乐,而且团队并非一次性全部投入。他们训练了一个单独的基于MOS的奖励模型来估计音频质量,然后对每个样本在其流派内进行分级,分为七个档次。Q1是最好的,Q7被丢弃。训练随后通过一个三阶段课程进行:首先使用Q3、Q6数据进行广泛覆盖,然后使用Q2数据进行质量巩固,最后使用Q1数据进行高质量精炼。

训练后流程也遵循类似的阶梯步骤。基于高质量精选数据的监督微调建立了一个清晰的生成先验。然后,迭代的DPO循环优化与人类音乐偏好和指令遵循的对齐。最后,在策略上的GSPO优化进一步推动音乐性。该团队报告说,这种阶段划分是刻意的:每个阶段都建立在前一个阶段的稳定基础上,而不是尝试在探索后修复对齐问题。

效果如何?评估结果具有竞争力。在600个中文和英文提示下,Qwen-Music在三个基准测试(SongBench、SongEval和AudioBox-Aesthetic)的16项客观指标中的13项中取得了最佳结果。在由专业人类评审进行的盲测A/B偏好测试中,Qwen-Music击败了MiniMax Music 2.5+(59.1%)、MiniMax Music 2.6(66.7%)、Mureka V8(58.3%)和Suno V5(55.4%)。对阵Suno V5.5时,胜率为50.3%,基本持平。该系统还以JazzCat的名称出现在Artificial Analysis的带人声音乐排行榜上,在英文声乐生成系统中排名第三。

翻唱歌曲生成与Suno V5.5、Suno V5和MiniMax Cover进行了对比测试。在AI生成的参考集上,Qwen-Music比三者更准确地保留了参考旋律。在真实世界的流行歌曲参考上,它在大多数指标上优于MiniMax Cover。这涵盖了参考音频可用的情况。

有一个关于旋律tokenizer的细节值得注意。该团队还尝试了基于色谱图的旋律条件化表示,类似于其他系统所使用的。他们发现色谱图通常保留太多关于背景编曲的信息,使条件化信号过强,降低了模型遵循全局风格标签的能力。因此,他们决定采用一种更干净的基于音高轮廓的方法,该方法剥离了除旋律形状之外的一切信息。这种设计选择就是让模型乖乖复制参考还是实际重新解释它之间的区别。

Qwen-Music尚未向公众开放使用,报告中也没有提及发布日期。目前,它代表了一个具有清晰架构叙事的技术里程碑:将作曲和渲染分开,明确规划旋律,并使用质量分级数据而非统一筛选进行训练。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。