人工智能
这款7B模型超越更大模型,可在手机上运行,改变AI成本方程
阿里云通义千问Qwen2.5-Omni是一款70亿参数模型,可实时处理文本、图像、音频和视频,同时生成语音和文本。其“思考者-说话者”架构和TMRoPE位置嵌入支持流式交互,30亿参数变体可在骁龙8 Gen 1等移动SoC上以可用速度运行。

大多数多模态模型只是为每种模态堆叠独立的编码器。Qwen2.5-Omni则有所不同。它将文本、图像、音频和视频视为单一端到端架构中的一等公民,并以流式方式生成文本和自然语音。该模型由阿里云通义千问团队于2025年3月底发布,此后两次登上Hugging Face趋势页面,并通过MNN进入移动端运行时。这是阿里巴巴推动AI走出实验室的更广泛努力的一部分,正如其530亿美元基础设施投资所示。
两个架构选择使Qwen2.5-Omni与众不同。首先,“思考者-说话者”分离:一个思考者模块处理多模态感知和推理,而一个说话者模块处理语音生成。这使得模型可以并行解码文本和音频,而不是顺序进行,这就是为什么它可以在流式输出语音回答的同时仍完成文字句子。其次,TMRoPE(时间对齐多模态RoPE)将视频帧的位置嵌入与相应的音频时间戳对齐,因此模型理解视觉事件和声音属于同一时刻。多模态信号同步的问题是已知挑战,其他架构也在解决,如一款自行纠正跨模态输出的AI所探讨的。

7B版本在大多数基准测试中与同等规模模型相比获得具有竞争力或更高的分数。在测试语音到文本推理的OmniBench上,Qwen2.5-Omni-7B达到56.13%的准确率,大幅领先Gemini 1.5 Pro的42.91%和MiniCPM-o的40.50%。在音频理解和推理基准MMAU上,其整体得分为65.60%,超过Qwen2-Audio超过16个百分点。在无字幕视频理解(Video-MME)上,达到64.3%,接近Qwen2.5-VL-7B和GPT-4o-mini。一个月后发布的3B变体保持竞争力:OmniBench 52.19%,MMAU 63.30%。这些基准测试凸显了小型模型挑战大型模型的更广泛趋势,这一模式也在在编码基准上击败137B模型的Laguna XS模型中可见。
对部署至关重要的数字在于资源方面。3B模型在移动SoC上需要约3.6 GB峰值内存,在骁龙8 Gen 1上以15.84 tok/s运行思考者解码,在8 Elite上为23.31 tok/s。说话者和Code2Wav模块增加了延迟,但端到端总吞吐量保持在8到20 tok/s的解码范围内,具体取决于硬件。这使得实时多模态助手可放入手机的散热预算中,而不仅仅是演示。在设备上运行此类模型的能力对需要低延迟响应的自主智能体具有意义,如并行智能体架构所讨论的。
7B变体在BF16下处理15秒视频输入需要约31 GB,这排除了移动设备,但可轻松容纳于单个A100或RTX 6000 Ada上。4位量化版本(GPTQ-Int4、AWQ)将内存削减超过50%,准确率下降很小:LibriSpeech测试集其他子集词错误率为3.71,而完整模型为3.4;MMLU-Pro为43.76,而完整模型为47.0。这些对于生产使用而言大多在噪声范围内。
移动部署的故事是值得关注的部分。MNN集成意味着Qwen2.5-Omni可在骁龙8 Gen 1、8 Elite等设备上运行推理。内存占用量,手机端7B为5.8 GB峰值,3B为3.6 GB,虽然高但并非旗舰设备无法承受。苹果的神经引擎模型和谷歌的Tensor芯片将有各自的答案,但一个开放权重的7B全模态模型能够装入手机内存,这在两年前是不可想象的。这种设备端能力的变化正在重塑AI智能体的部署方式,这一主题在刚刚被打破的3140亿美元假设中有所探讨。
论文对局限性坦诚相告。“思考者-说话者”架构无法处理音频输出的非约束提示设置,系统提示必须设置为特定身份字符串才能使语音生成工作。说话者模块增加约2 GB GPU内存,禁用它可节省内存但代价是仅文本输出。视频URL支持取决于后端(torchvision >= 0.19.0处理HTTP和HTTPS;decord仅处理HTTP)。截至2025年5月,vLLM服务仅支持思考者,音频输出需要自定义vLLM分支。这些是可解决的工程差距,而非根本缺陷。
Qwen2.5-Omni表明,全模态模型不再仅仅是研究好奇。一个在专用语音识别器、图像推理器和视频基准测试上表现更佳,且能在手机上运行的模型,改变了实时语音助手、无障碍工具和实时视频分析的成本方程。下一个问题是阿里云是否会将其快速转化为有影响力的产品,或者留给那些先在开放权重上构建的人。该公司更广泛的战略表明它已在思考超越模型本身,如其平台优先策略所示。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。