SevenTnewS

开源TTS

Audio8的新TTS模型免费克隆11种语言的语音

Audio8以Apache 2.0许可发布Audio8-TTS预览版,这是一个0.6B参数的模型,支持11种语言、零样本语音克隆,并捆绑了44.1 kHz编解码器。该发布针对需要速度和隐私的边缘语音应用。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-30 · 阅读需 1 分钟

Audio8的新TTS模型免费克隆11种语言的语音
来源 : Samuel Zeng thr…

Audio8的新模型模糊了云端与本地语音合成之间的界限。今天发布的Audio8-TTS预览版拥有6亿参数,支持11种语言的零样本语音克隆,捆绑了44.1 kHz音频编解码器,全部遵循Apache 2.0许可证,与41位签署者刚刚在一封公开信中捍卫的开放权重运动保持一致。

凭借6亿参数,该模型可在消费级硬件上运行,并能从短样本中克隆语音而无需微调。Audio8称其为需要速度、覆盖范围和隐私的语音应用程序提供了单一栈。运行在本地意味着音频不会离开设备,这是企业部署越来越需要的隐私优势,如一项AI基础设施策略比较中所涵盖的。

小型语音模型正在快速追赶。Voxtral Realtime是一款开源流式ASR模型,今年早些时候以480毫秒的延迟匹配了Whisper的质量。阿里巴巴的Qwen2.5-Omni可在手机上运行。Nvidia的Cosmos 3 Edge同样将世界建模压缩到40亿参数用于设备端任务,在其尺寸类别中于VANTAGE-Bench排名第一。Audio8的做法是生成式的:它创造语音而非转录。凭借6亿参数,它保持在10亿以下,而大多数开源TTS模型位于此标记之上,并且零样本克隆可从英语扩展到普通话。

捆绑的44.1 kHz编解码器消除了对单独声码器的需求,并默认提供清晰输出。该

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。