SevenTnewS

人工智能

480毫秒延迟、Whisper级别准确率、开源配方:Nvidia Canary重新定义实时ASR

英伟达的Nemo Canary模型在LibriSpeech和Common Voice上达到了Whisper级别的准确率,同时实现480毫秒延迟的流式处理。开源版本包含训练脚本和权重,使其成为实时ASR中罕见的可复现竞争者。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-26 · 阅读需 2 分钟

480毫秒延迟、Whisper级别准确率、开源配方:Nvidia Canary重新定义实时ASR
来源 : NVIDIA Nemo Can…

自2022年以来,Whisper一直是转录的标准,但其离线设计意味着需要等待完整的语音输入。Nvidia本周开源发布的Nemo Canary模型宣称在480毫秒延迟下实现流式处理,同时匹配Whisper的准确率。

架构:为何流式不再拖后腿

Canary采用了带有多token解码器的FastConformer transducer,每步预测六个token。这种设计在图像生成中常见,但在ASR领域罕见,它使模型能够更快地输出子词单元,而无需等待完整的音频窗口。可提示的解码器让用户无需重新训练即可控制输出风格、标点、大写、时间戳预测。

该系列包括三种规模:Canary-180M、Canary-1B和Canary-1B-Code。1B版本支持四种语言(英语、德语、法语、西班牙语),并包含针对双语流代码切换模式。180M模型在准确率上有所取舍以追求速度,面向边缘设备,与其他边缘模型如Mistral Nano类似。

基准测试:与Whisper正面交锋

在LibriSpeech clean上,Canary-1B的词错误率为1.9%,与Whisper medium持平,比Whisper large高0.3%。在Common Voice英语上,差距进一步缩小:Canary-1B为5.8% WER,Whisper large为5.6%。端到端测量的流式延迟为480毫秒,大约是说“hello”一词所需时间。在同一GPU上,Whisper large需要3.2秒,这一差距凸显了通过迭代细化,较小模型可与十倍大模型匹敌的趋势。

模型LibriSpeech clean WER (%)Common Voice英语WER (%)延迟 (毫秒)
Canary-1B1.95.8480
Whisper medium1.96.22600
Whisper large1.65.63200

可复现性作为差异化因素

准确率数字令人印象深刻。对社区而言更重要的是,Nvidia发布了NeMo框架内的完整训练配方,包括数据集预处理步骤。Whisper的论文省略了这些细节,使得社区难以验证或改进。Canary的训练可从零复现,这一点与简化部署基础设施的努力一致。

“我们想展示最先进的ASR并不需要黑魔法,”PDF中写道。“每个配置文件都在NeMo中。”如果这一说法得到验证,将减少团队在领域特定微调(医疗、法律或口音语音)上的前期工作,而无需从零开始。

不足之处

Canary仅覆盖四种语言。Whisper支持99种。代码切换模式仅限于英语与另一种语言配对,并非真正的多语言混合。此外,480毫秒延迟假设单GPU且批大小为1;生产环境中共享硬件上的部署往往会使这些数字扩大

尽管如此,开源社区现在拥有了一个可信的流式替代方案,在准确率上与领先者持平,同时将延迟缩短了六倍。接下来的考验是社区是否会采纳并扩展它,遵循其他达到大规模采用的开源权重模型的路径。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。