成本分析
微软自研AI模型在生产中最高降低GPU成本89%
微软报告称,其MAI-2.5和MAI-Voice-2-Flash模型现已投入Bing、PowerPoint和Dynamics 365的生产环境,图像生成GPU成本降低84%,语音任务降低89%。自研模型战略正在带来相较于第三方替代方案可衡量的成本优势。

微软已将自研MAI模型部署到广泛的产品中,早期回报体现在成本上,而非仅仅是质量。该公司周三公布的数据显示,在PowerPoint图像到图像任务中,MAI-Image-2.5相比GPT-Image-2将GPU成本降低了84%;在Dynamics 365 Contact Center中,MAI-Voice-2-Flash将GPU成本最多降低了89%。
这些数据之所以重要,是因为它们将讨论从排行榜位置转向真正决定企业采用的因素:总拥有成本。微软不仅在图像质量或语音真实感上竞争,更是在规模化推理成本上展开竞争,而数据表明该公司已找到了巨大的差距。
超越营销的生产力证明
微软的做法与Google的Gemma 4或Meta的Muse Spark等开放权重发布趋势不同。微软并非提供一款供开发者随处部署的模型,而是首先为自己的产品构建。Bing Image Creator现已完全由MAI-Image-2.5驱动。OneDrive图像编辑将其作为默认模型,该公司报告称,切换后保存率提高了26%,P95延迟降低了25%。
节省同样体现在语音方面。在Build大会上推出的MAI-Voice-2-Flash现已成为Dynamics 365 Contact Center的骨干,被包括T-Mobile和EasyJet在内的客户使用。其速度是MAI-Voice-2的两倍,字符定价低32%,生产中的GPU成本降低达到89%。
MAI-Image-2.5-Pro是GenMedia工具的一次重大飞跃。除了令人印象深刻的图像质量,它能够以如此高的精度渲染文字是一项真正的突破。它还能理解自然语言编辑,使创意迭代变得更快、更直观。微软已牢固地确立了其在生成式AI领域的领先地位。
, , Rob Reilly,WPP全球首席创意官
数据中的成本优势
微软公布的特定性能改进超越了典型的基准声明。下表总结了该公司发布的生产数据:
| 场景 | 相较于前代的改进 | 模型 |
|---|---|---|
| PowerPoint图像任务 | GPU成本降低84% | MAI-Image-2.5 |
| Dynamics 365语音 | GPU成本降低89% | MAI-Voice-2-Flash |
| OneDrive图像编辑 | 效率提升2.5倍,P95延迟降低25% | MAI-Image-2.5 |
| Dragon Copilot转录(58种语言) | 相对错误率降低50% | MAI-Transcribe-1.5 |
与Dragon Copilot的合作表明这一战略已延伸至消费产品之外。这款医疗文档工具被17万名提供者使用,上一季度处理了2800万次患者会诊,现已采用MAI-Transcribe-1.5。内部评估显示,在大多数语言中,转录和语言识别错误率均相对降低了50%。
定价与定位
MAI-Image-2.5-Pro现已进入公开预览阶段。其定价为每100万文本输入令牌5美元,每100万图像输入令牌8美元,每100万图像输出令牌106美元。MAI-Voice-2-Flash的定价为每100万字符15美元,比MAI-Voice-2便宜32%。该公司表示,这些模型使用干净、可追溯、企业级的数据进行训练,未从第三方模型进行蒸馏。
微软通过MAI Foundry和Azure Voice Live集成提供这些模型,后者允许开发者构建低延迟的语音到语音智能体。
对市场意味着什么
微软此举给那些依赖第三方API或无法实现为自有基础设施构建的垂直整合的模型供应商带来了压力。OpenAI和Anthropic等公司面临一个局面:微软既能构建有竞争力的模型,又能以零分发摩擦将其融入产品中。
如今在MAI投入运营的GB200集群表明,计算投资仍在继续。对于企业买家而言,计算逻辑正在转变:来自平台厂商的专有模型可能不仅提供便利,还能在规模化时带来真正的成本优势。
这并不意味着微软在任何单一能力上成为绝对的领先者。但它构建了一道护城河:每个切换到MAI模型的产品都能节省成本,这些节省随着规模增长而累积。这是一种难以通过缺乏类似产品生态系统的对手复制的优势。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。