Qwen / 阿里云
Qwen2.5-Omni 在 OmniBench 上超越 Gemini-1.5-Pro,可在 12GB 以下显存运行
阿里开源模型 Qwen2.5-Omni 在 OmniBench 上得分超过 Gemini-1.5-Pro,并登顶 MMAU 音频推理排行榜。量化版本将显存占用降至 12GB 以下,MNN 支持将实时语音对话带到手机上。

阿里云 Qwen 团队于 2025 年 3 月 26 日发布了 Qwen2.5-Omni,其代码仓库中的数字已说明一切。该模型是端到端多模态模型:接收文本、图像、音频和视频作为输入,并以流式文本和自然语音回应。7B 版本于 4 月 2 日登顶 Hugging Face 趋势榜,3B 版本于 4 月 30 日紧随其后,团队在发布时还同步发表了技术报告(arXiv 2503.20215)。
最引人注目的结果是基准测试差距。在要求模型同时使用多种模态的 OmniBench 测试中,Qwen2.5-Omni-7B 平均得分 56.13%,3B 版本得分 52.19%,而 Gemini-1.5-Pro 为 42.91%。这些是团队自行公布的数据,也是这次发布值得仔细审视的原因。
音频推理的表现也类似。在 MMAU 上,7B 平均得分 65.60%,领先于同一表格中 Gemini-Pro-V1.5 的 54.90%。团队在 6 月 9 日的更新中声称在 MMAU 排行榜上位列第一,并在 MMAR 上位列开源模型第一。三天后,它又在口语理解与推理基准 MMSU 上报告了开源模型第一名的成绩。
| 基准测试(平均) | Qwen2.5-Omni-7B | Qwen2.5-Omni-3B | Gemini-1.5-Pro |
|---|---|---|---|
| OmniBench | 56.13% | 52.19% | 42.91% |
| MMAU(音频理解) | 65.60% | 63.30% | 54.90% |
数据以 Qwen2.5-Omni 代码仓库发布为准。MMAU 表格将 Gemini 结果标注为 Gemini-Pro-V1.5;OmniBench 表格使用 Gemini-1.5-Pro。
在单模态测试中优势依然成立。在 LibriSpeech test-other 上,7B 的词错误率为 3.4,略优于 Whisper-large-v3 的 3.6。在 Common Voice 15 上,它在所列的全部四个语言子集上均超过 Whisper-large-v3,其中中文差距为 5.2 对 12.8。
Thinker-Talker 架构与实时语音
架构是大多数发布藏在 API 背后的部分。Qwen2.5-Omni 分为 Thinker(思考器)和 Talker(说话器)两部分:前者对文本、图像、音频和视频进行推理,后者生成语音。一种名为 TMRoPE 的位置嵌入将视频时间戳与音频对齐,使模型能够在观看时听到屏幕上发生的事情。实时语音和视频对话于发布当天在 Qwen Chat 上线。
语音输出接近专用 TTS 系统。在 SEED 基准的 hard 集上,经 RL 调优的 7B 在内容一致性上的词错误率为 6.54,而 Seed-TTS_RL 为 1.94,CosyVoice 2 为 6.83。说话人相似度为 0.752,略低于 Seed-TTS_RL 的 0.782。对于一款同时能够阅读、观看和推理的模型来说,这是相当不错的表现。
面向消费级 GPU 的 11.64GB 版本
对于没有 GPU 集群的人来说,重要的发布在 5 月 16 日到来。团队发布了 7B 的 4-bit GPTQ-Int4 和 AWQ 版本。15 秒视频输入在 BF16 下需要 31.11GB 显存,使用 GPTQ-Int4 后降至 11.64GB,使用 AWQ 后降至 11.77GB。README 将 RTX 3080、4080 和 5070 列为目标硬件。几天前,MNN 支持已将模型带到手机上,7B 在骁龙 8 Gen 1 和 8 Elite 上的内存峰值达到 5.8GB,3B 为 3.6GB。4 月 30 日发布的更轻量级 3B 版本,是为了让更多平台能够运行该模型。
权衡取舍在同一个表格中显而易见。量化会损失一些准确性和少量速度:GPTQ 版本上 MMLU-Pro 从 47.0 降至 43.76,而 VideoMME 在 AWQ 上保持 72.0,原生版本为 72.4。团队指出,显存数据是理论最小值,实际使用约为其 1.2 倍。11.64GB 的数字也只覆盖 15 秒视频。到 60 秒时会升至 29.51GB。低于 12GB 的说法只对短输入成立。
自报数据的薄弱之处
部署存在一些注意事项。标准的 OpenAI 兼容服务路径 vLLM serve 仅支持 Thinker,这意味着只能输出文本;音频生成需要使用 end2end 脚本。DashScope API 模型 qwen-omni-turbo 仅支持流式输出。此外,音频输出依赖特定的系统提示词"You are Qwen, a virtual human...",否则可能根本无法生成语音。
上述所有数据均来自构建该模型的团队。与纯文本 LLM 相比,对 omni 模型的独立验证更为稀少,因为评估体系较新。经得起检验的是大方向:一个开源 7B 模型在综合多模态任务上超越了旗舰闭源模型,而 4-bit 版本让实时语音交互在 12GB GPU 上成为可能。第三方测试能否证实这些差距,是下一轮基准测试应该回答的问题。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。