SevenTnewS

模型评测

Qwen2.5-Omni:开源模型终于实现了竞品只承诺的功能

深入解读这个开源模型,它能同时处理文本、图像、音频和视频,并生成流式语音,在多项基准测试中超越GPT-4o-mini和Gemini,且通过量化可适配单张消费级GPU。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-03 · 阅读需 4 分钟

Qwen2.5-Omni:开源模型终于实现了竞品只承诺的功能

阿里巴巴Qwen团队发布了Qwen2.5-Omni,这是一个70亿参数的多模态模型,可同时处理文本、图像、音频和视频,并能生成流式语音输出。在基准测试中,它击败了开源竞争对手和专有竞争者,且全部在单张GPU上运行。

该模型采用思考者-讲话者架构,将感知与生成分离。思考者负责多模态编码。讲话者则合成流式语音或文本。一种自定义位置嵌入TMRoPE将视频时间戳与音频同步,使模型能够实时跨模态理解。

Qwen2.5-Omni脱颖而出的关键在于其综合性能。在衡量语音、声音事件和音乐理解的OmniBench基准测试中,7B版本得分56.13%,领先Gemini 1.5 Pro(42.91%)13个百分点。在音频推理(MMAU)中,它总体得分65.6%,超过Gemini-Pro-V1.5(54.9%)和Qwen2-Audio(49.2%)。语音生成质量同样出色:在SEED测试困难集上,经RL优化的变体词错误率为6.54%,与专用TTS模型Seed-TTS_RL(6.42%)相当。

更引人注目的是该模型的图像理解能力。尽管是一个全能模型,Qwen2.5-Omni-7B在MMMU上与专用视觉模型Qwen2.5-VL-7B相当(59.2 vs. 58.6),在MMStar上超越后者(64.0 vs. 63.9),在MathVision上持平(25.0 vs. 25.1)。在OCR基准测试DocVQA中,它得分95.2%,而Qwen2.5-VL-7B为95.7%,差距微乎其微。GPT-4o-mini在大多数视觉基准测试中落后:MMMU 60.0 vs. 59.2,MathVista 52.5 vs. 67.9,MMStar 54.8 vs. 64.0。

视频理解也是如此。在带字幕的Video-MME上,Qwen2.5-Omni-7B达到72.4%,超过Qwen2.5-VL-7B(71.6%)和GPT-4o-mini(64.8%)。在MVBench上,它得分70.3,而纯视觉版本为69.6。

架构与训练

思考者-讲话者架构不仅仅是一个巧妙的名称。思考者是一个仅解码器的Transformer,以Qwen2.5为骨干,并添加了音频和视频编码器。它对所有模态使用因果注意力,模型按顺序和上下文处理输入,无需单独的融合模块。讲话者是一个轻量级解码器,接收思考者的最后隐藏状态,并通过编解码器生成文本token或语音token。两个模块通过交错训练共享参数:思考者每一步都更新,但讲话者仅在语音生成时更新。

训练分三个阶段进行:使用1.2万亿token多样化数据进行模态对齐,对130万文本-图像-视频样本和17万小时音频进行多任务监督微调,以及通过人类反馈强化学习优化语音质量。结果是一个能听问题、看视频、推理两者并用自然语言回答的模型,全部在一次前向传播中完成。

实际部署

与需要云API的Google或OpenAI的全能模型不同,Qwen2.5-Omni可在消费级硬件上运行。7B版本在BF16和FlashAttention-2下需要31 GB GPU内存,可放入RTX 4090。量化版本(GPTQ-Int4, AWQ)将内存需求降至12 GB以下,可放入RTX 3080或4080。存在3B变体用于边缘设备,支持移动SoC上的MNN:在Snapdragon 8 Elite上,思考者解码速度为11.52 tok/s,生成语音速度为27.36 tok/s。

部署非常简单。该模型已集成到最新的Hugging Face Transformers(v4.52.3)和vLLM中。Docker镜像已提供。仓库中的代码示例显示,用不到20行Python即可完成推理。

需要改进之处

纯文本表现落后于类似规模的纯语言模型。在MMLU-Pro上,Qwen2.5-Omni-7B得分47.0,而Qwen2.5-7B为56.3。这一差距表明多模态训练在纯语言推理上带来了取舍。该模型还需要一个特定的系统提示来生成语音,这对于希望自定义行为的开发者来说是一个脆弱的约束。此外,尽管OmniBench性能令人印象深刻,但尚未被第三方独立复现。

语音输出目前仅支持两种预设声音(Chelsie和Ethan),尽管阿里云的API服务提供四种。本地微调自定义声音的方法未被文档化。

结论

Qwen2.5-Omni是一项罕见的成就:一个开源模型,在其领域设立了新标准,同时能在开发者已有的硬件上运行。它在全能任务上不仅匹配专有竞争者,还在大多数基准测试中超越它们。纯文本方面的取舍是真实存在的,但对于一个旨在统一模态的模型来说可以接受。对于任何构建实时语音代理、视频理解管道或多模态助手的人而言,这是值得作为起点的开源模型。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。