AI与研究
68.4%胜率让ElevenLabs显得脆弱
Voxtral TTS在多元语言语音克隆方面树立了新标杆,在偏好对比测试中以68.4%的胜率击败ElevenLabs Flash v2.5。其混合架构及开源权重发布可能重塑TTS格局。

多年来,文本转语音市场一直由少数几家专有API主导。ElevenLabs凭借其表现力强、延迟低的语音,成为开发者构建语音助手、有声读物和配音工作流的默认选择。如今,这一默认选择有了一个可信的开源对手,数据表明差距正在快速缩小。 生成式AI内容工厂正在侵蚀你署名的价值
Voxtral TTS背后的研究人员已发布技术报告和模型权重,采用CC BY-NC许可。在一项覆盖多种语言的盲测偏好实验中,母语者选择Voxtral而非ElevenLabs Flash v2.5的比例为68.4%。这一差距表明,开源TTS不仅正在追赶,在某些方面甚至已经领先。 本地大语言模型中Gemma和Qwen如何驯服大规模开源仓库问题分类
混合架构,而非单一Transformer
与许多依赖纯自回归或完全非自回归设计的TTS模型不同,Voxtral TTS将任务分为两个阶段。首先,一个自回归Transformer生成语义语音令牌:这些高级表示捕捉含义、韵律和说话人身份。接着,一个流匹配模型将这些语义令牌转化为声学令牌,携带音高、音色和节奏的细粒度细节。
这种混合方法在生成声学细节时减少了自回归误差累积,同时保留了使合成语音听起来自然的表达性节奏。这些令牌由Voxtral Codec处理,这是一个采用混合VQ-FSQ量化方案训练的语音分词器,旨在跨语言保留语音特质。 为什么一句话指令生成文章,恰恰偏离了新闻业的本质
少量样本语音克隆,仅需三秒钟
Voxtral仅需三秒钟的参考音频即可克隆一个声音。这使得它在实际应用中非常实用,尤其是当说话人的录音有限时。推理时无需微调或针对每个说话人进行适配。系统直接从简短参考中提取声音特征。
在多语言测试中,母语者认为Voxtral TTS在法语、德语、西班牙语和中文上的自然度优于ElevenLabs Flash v2.5。英语结果也偏向Voxtral,但优势较小。研究人员将此归因于分词器在一个平衡的多语言语料库上训练,而非以英语为主的语料库。 反对“劣质化”的案例:为何专业化、主权AI始终优于通用试点项目
开源权重发布意味着什么
通过以CC BY-NC许可发布权重,该团队在商业应用上并未做到完全开源。但对于研究社区、爱好者和内部原型开发而言,准入门槛几乎为零。开发者可以在本地运行Voxtral TTS,进行定制,并在其上构建,无需支付按字符计的API费用。
这给商业提供商带来了压力,促使它们在基础设施、延迟或许可协议上而非原始语音质量上实现差异化。ElevenLabs在低延迟流式传输和实时语音转换方面投入了大量资源,而Voxtral TTS尚未在这些领域宣称优势。但质量差距正在缩小,价格差距依然悬殊。
对TTS生态系统的影响
Voxtral TTS的出现正值其他几款开源TTS模型涌现之际,包括Fish Audio S2和MOSS-TTS,形成了对主流API的可替代选择走廊。这一趋势与大型语言模型领域发生的情况相似:一旦架构公开且权重被共享,市场就从基于访问的价值转向集成和定制化。 NSF OMAI 上线:Ai2 的全开放 AI 集群是对封闭研究的挑战
对于构建多语言语音助手的开发者而言,这意味着能够选择一种可微调、可本地运行且不按字符收费的模型。对于研究人员,Voxtral的混合设计提供了一个参考点,可能加速在自回归和流式生成边界上的进一步实验。 DeepSeek-V4 预览版发布,开放权重模型竞争愈发激烈
68.4%的胜率只是一次评估,并非加冕。但它表明,闭源TTS的现有玩家再也不能仅依赖质量作为护城河。对话已经从“开源能否追上闭源?”转向“生态系统其他部分将多快采用它?”
- 来源 : ElevenLabs just got a serious challenger — and it's open source — 2026-03-27
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。