语音AI
语音AI在词汇理解上进步显著,但仍无法领会你的语调
Hume的Real World VoiceEQ基准基于超过一百万次人工评级,测试了40多个语音模型在标准基准忽略的维度上的表现:情绪、说话者身份和声学环境。结果表明,语音到语音模型表现差异巨大,即使是领先系统也常常忽略人类本能使用的语音线索。

语音本应是AI的下一个重要界面。客户支持、医疗保健、教育、个人助手, , 这一愿景多年来始终如一。从纸面上看,情况良好。词错误率下降,延迟达到对话速度,常规基准已接近饱和。
但任何真正与语音AI交谈超过一分钟的人都清楚,差距依然显著。一个以某种声音开始的模型,可能在结束时听起来像另一个人。银行代理愉快地说“我理解你的沮丧”,却没有丝毫共情。系统用通用回答填补的停顿,因为它完全错过了用户的犹豫。
标准基准无法捕捉这些。Hume,这家专注于共情语音AI平台的公司,构建了一套名为Real World VoiceEQ的新评估套件,旨在衡量这些指标遗漏的内容。结果描绘了一幅混乱的图景:该领域在优化速度和准确性的同时,牺牲了更难以评分的东西, , 另一端的声音是否真正听起来像人类。
方法:一百万次评级,40多个模型
该基准评估了40多个专有和开源语音模型,涵盖15个评估维度和60多项指标,包括ASR、TTS、语音到语音(S2S)和语音理解。数据来自超过一百万次人工评级,收集自不同人口统计、说话风格和声学环境。当前版本包含785,000次TTS评级和48,000次STS评级,是公开进行的语音AI最大规模人工评估之一。

每次评级均使用Hume自己的评估平台Kairos收集,该平台也被前沿实验室用于运行自定义评估和生成人类偏好数据。
没有单一的赢家
主要发现是实践者早已怀疑的一点:不存在最好的语音模型。在TTS评估中,没有系统配置在基准定义的所有八个能力组中排名前五。模型针对不同方面进行优化。一个可能完美发音复杂的药品名称和银行账号,但产生生硬单调的语音;另一个可能听起来非常自然,但在精确任务上表现不佳。
语音到语音模型的变化最为极端,这些模型在同一流程中处理识别和生成。一些模型能很好识别情绪,但无法自然回应。其他模型则主要依赖转录文本,关注说的词语而忽略语调、节奏、犹豫、强调和音量。
最后一点最令人困扰。人类不断使用这些线索。自信的“是”和犹豫的“……是……”含义完全不同,但转录文本看起来一样。基准发现,即使接入音频,也不能保证代理使用其中包含的副语言信息。
数字掩盖的真实问题
基准还凸显了总分如何掩盖失败模式。在一个例子中,噪声背景语音的转录词错误率大约是音乐背景语音的四倍。单一的背景音频分会抹平这一差异,使失败变得不可见。
在初步研究中,Hume还发现一些模型可能针对公共基准而非真实条件进行优化。几个模型复现了参考转录中的已知错误,遵循任意拼写惯例,甚至重构了音频中不存在的掩码词。
自动评估尚未成熟
LLM被广泛用于评估文本模型。Hume的发现表明,语音语言模型(SLM)在语音评估中应谨慎使用。当公司将领先的SLM与训练有素的人工评分员在TTS评估中进行比较时,在具有清晰可验证答案的任务(如发音准确性)上一致性最高。在更主观的评估上,一致性急剧下降。SLM有时似乎从文本上下文线索而非声学线索推断情绪。最弱的一致性出现在开放式判断上,例如声音是否适合角色或在对话中保持了身份一致性。
自动评估器适用于定义明确的任务。但当涉及上下文、感知和社会解读时,它们无法替代人类听众。
Hume将Real World VoiceEQ定位为传统评估范式的延伸, , 一种基于人类直觉的、针对合成语音中定量评分从未很好捕捉的组成部分的度量标准。完整技术报告和排行榜已公开。公司还通过其Kairos平台提供定制评估。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。