SevenTnewS

多模态AI

阿里巴巴Qwen2.5-Omni:欲打造集听、看、说于一体的全能模型

阿里云的Qwen2.5-Omni端到端处理文本、图像、音频和视频,实时生成文本和自然语音。基准测试显示,它往往与专业单模态模型持平或更优,暗示向统一架构的转变。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-20 · 阅读需 5 分钟

阿里巴巴Qwen2.5-Omni:欲打造集听、看、说于一体的全能模型

AI模型领域长期以来按感官划分:视觉模型处理图像,音频模型处理声音,文本模型处理语言。但这种分类法只在研究实验室内有意义。在现实世界中,一次对话同时涉及面部表情、语调以及词语本身。阿里云Qwen团队押注下一个前沿就是同时处理一切

随着Qwen2.5-Omni的发布,该公司推出了一款端到端多模态模型,可接收文本、图像、音频和视频,并以流式方式输出文本和自然语音。该模型是开源的(提供7B和3B参数版本,采用宽松许可),团队还发布了详细技术报告。但单从数据本身就能看出其值得关注之处。

对Gemini及Qwen家族自身构成挑战

Qwen2.5-Omni论文中最引人注目的结果之一是OmniBench表格:在口语理解与推理基准MMSU上,7B模型得分为61.32,在开源同行中仅次于Baichuan-Omni-1.5的57.25,但关键的是领先于所有其他开源替代方案。在更广泛的OmniBench套件(测试语音、声音事件和音乐)上,Qwen2.5-Omni-7B达到56.13%,轻松击败Gemini-1.5-Pro的42.91%和MiniCPM-o的40.50%。在仅音频推理基准MMAU上,它得分为65.60,远超Qwen2-Audio(49.20)甚至Gemini-Pro-V1.5(54.90)。

但真正令人瞩目的,是它与自家专业版本模型的比较。Qwen2.5-Omni-7B在MMMU(59.2)、MathVista(67.9)、TextVQA(84.4)和DocVQA(95.2)上的图像到文本得分,与Qwen2.5-VL-7B的58.6、68.2、84.9和95.7相差无几。视频基准测试同样接近:在MVBench上,全能模型以70.3比69.6微弱领先于纯视觉版本。这表明,添加音频和语音理解并未损害视觉性能,这是一项非平凡架构成就。

在音频方面,Qwen2.5-Omni-7B在LibriSpeech test-other上的ASR词错误率为3.4,与Whisper-large-v3持平,并击败Llama-3-8B(3.4对报告中的3.5)。在Common Voice英语上为7.6,同样可与Whisper-large-v3的9.3竞争。在CoVoST2(英译德)上的语音到文本翻译得分为30.2,领先于Qwen2-Audio(29.9)和未报告英德数据的MiniCPM-o。语音生成指标方面,在Seed-TTS hard基准上的WER为6.54(RL模型),与CosyVoice 2-S的8.08和Seed-TTS_RL的6.42相当。

架构:思考者与讲述者

在底层,Qwen2.5-Omni采用名为Thinker-Talker的双模块架构。Thinker是一个多模态Transformer,使用自定义位置嵌入TMRoPE(时间对齐多模态RoPE)交错文本、图像、音频和视频令牌,该嵌入在时间戳级别同步视频帧及其音频轨道。Talker是一个专用语音解码器,接收Thinker的隐藏状态并生成流式音频输出。这种分离允许系统例如在转录用户语音查询的同时生成语音回复,而无需等待整个输入结束。

该模型还支持分块音频输入以实现实时交互,团队通过Qwen Chat语音和视频通话界面演示了该功能,现在开发者可通过DashScope上兼容OpenAI的API使用。

但最酷的成就或许是在手机上运行

这里最实际的成就或许不是基准分数,而是一张内存消耗表。BF16精度的Qwen2.5-Omni-7B处理15秒视频输入需要31.11 GB内存,远超消费级GPU的能力。但团队发布了4位量化版本(GPTQ-Int4和AWQ),分别将需求降至11.64 GB和11.77 GB,使推理可在RTX 3080或4080上运行。更令人印象深刻的是,该模型现通过MNN在边缘设备上运行:在骁龙8 Gen 1手机上的7B变体使用5.8 GB峰值RAM,解码速度为11.52 tokens/s,虽慢但可用于基本语音聊天。在骁龙8 Elite上的3B模型将解码速度提升至23.31 tok/s。

将能理解关于实时摄像头画面的口语问题并回应的模型移动化,不仅是演示;它开启了现场服务、无障碍和实时翻译等应用场景,这些场景原本需要多个独立模型拼接而成。

企业级影响:气隙版Qwen

Qwen2.5-Omni还与基础设施布局一同到来:Hermetic AI Sandbox,由阿里云MVP Arslan ud Din Shafiq构建的参考架构,用于在完全气隙VPC中部署Qwen模型,无需互联网访问。该设置使用阿里云PAI-EAS专用资源组、用于OSS存储的VPC端点以及PrivateZone DNS,路由模型权重加载而无需接触公共互联网。它明确设置"enable_internet_access": false,并用从Jira、Confluence或本地数据库拉取数据的内部代理替换外部RAG工具链。

这点很重要,因为银行业、医疗和国防的合规性常直接阻止生成式AI部署。展示在不离开VPC的情况下部署相同最前沿模型的路径,可能解锁停滞的采购周期。

不足:尚未达到手腕上的Siri级别打磨

但这并非说Qwen2.5-Omni已准备好替代专业语音助手。相比之下,The Verge对watchOS 27 beta的预览强调了Apple的Siri AI如何受益于紧密集成、手机与手表间一致的回答、共享上下文以及十年用户界面打磨。通用多模态模型尚不具备这一优势。Qwen2.5-Omni在手机上的语音聊天可行,但延迟、提示词脆弱性(必须逐字设置系统提示词才能使音频输出工作)以及缺乏精致的唤醒词体验,使其目前仍停留在开发者沙盒中。

尽管如此,技术方向是明确的。如果说2024年是聊天模型之年,那么2025年越来越像是行走、说话、视觉AI之年。Qwen2.5-Omni展示了统一架构可以在不妥协的情况下匹配专业模型,并且开源可以像最大实验室一样快速推动这一前沿。现在的问题不再是多模态模型是否会到来,而是谁能让它们首先感觉自然。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。