语音识别
4 published articles
NLP与机器学习4 min read
AI 研究
Voice Memory:一个 776 字节的文件,告诉语音识别何时什么都不做
一种新的仅推理方案学会了克制:一个冻结的修正器读取按领域划分的记忆文件并决定何时放弃修正。不受约束的修正会在多达 64% 的编辑中破坏正确词元;Voice Memory 将这一比例降至 35%,并把加权 WER 从 8.36% 降至 7.52%。
2026-08-06
人工智能Featured2 min read
人工智能
480毫秒延迟、Whisper级别准确率、开源配方:Nvidia Canary重新定义实时ASR
英伟达的Nemo Canary模型在LibriSpeech和Common Voice上达到了Whisper级别的准确率,同时实现480毫秒延迟的流式处理。开源版本包含训练脚本和权重,使其成为实时ASR中罕见的可复现竞争者。
2026-07-26
开源Featured3 min read
开源AI
480毫秒与开源:Voxtral Realtime在Whisper的赛道上发起挑战
Voxtral Realtime以低于一秒的延迟达到了离线转录质量,并且是开源的。该13语言模型采用了一种新颖的因果音频编码器,并针对流式传输进行了端到端训练,而非从离线系统改造而来。
2026-07-17
大语言模型与模型3 min read
人工智能
英伟达新音频模型同时处理五大任务,专攻者在其领域反而落败
英伟达的 Audex 将音频理解、生成与文本推理统一于单一模型,在语音与音频基准测试上匹配或超越任务专用系统,且未牺牲文本性能。
2026-07-09