SevenTnewS

网络安全AI

微软MAI-Cyber-1-Flash以一半成本在CyberGym基准测试中取得最高分

微软新款MAI-Cyber-1-Flash模型集成到MDASH框架中,承诺以一半成本实现前沿级别的漏洞检测。该公司表示,该系统在CyberGym基准测试中优于Mythos、Gemini和GPT。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-29 · 阅读需 3 分钟

微软MAI-Cyber-1-Flash以一半成本在CyberGym基准测试中取得最高分
来源 : Microsoft blog:…

网络安全AI面临成本问题。足够强大、能够发现真实漏洞的模型在规模化运行时成本高昂,而需要扫描的代码量增长快于预算。微软认为它有一个解决方案:一个经过调优的多模型系统,将大部分工作交给一个廉价的专用模型,将昂贵的模型留给最困难的情况。

该公司在周一推出了MAI-Cyber-1-Flash,一款源自MAI-Thinking-1系列的紧凑型模型,并宣布它将成为MDASH(其多智能体漏洞识别与修复架构)的默认模型。微软表示,该组合在CyberGym基准测试中达到96%的得分,比来自一个未具名实验室的竞争对手Mythos高出12个百分点。整个系统的成本比微软此前使用GPT-5.4、5.4 mini和5.3 codex的最佳配置降低50%。

“安全是一项始终在线的使命,考虑到海量的入站攻击,令牌成本如今已成为防御者的真正制约因素,”该公司在博客文章中写道。

微软的主张基于分工:MAI-Cyber-1-Flash处理高达90%的任务,而一个更大的模型(目前是GPT-5.4)则介入剩余10%需要更深推理的任务。这种混合方法并非独一无二, , 谷歌的Gemini 3.5 Flash Cyber在CodeMender内使用多次Flash代理调用来生成单个漏洞报告, , 但微软将其数据优势定位为差异化因素。该公司从其自身安全堆栈中每天看到数万亿个跨身份、端点、云和网络的信号,以及来自160万客户的操作洞察。

“没有人能制造这段历史,”博文写道。

网络安全AI的竞争领域已经变得拥挤。Anthropic故意限制了Claude Opus 5的网络安全能力,制造了一个专家们已经在利用的盲点。Sakana AI的Fugu-Cyber在V8 JavaScript引擎中发现的确诊漏洞比Claude Opus 4.6更多。谷歌的Gemini 3.5 Flash Cyber仅限于政府和受信任的合作伙伴,限制了其市场覆盖。微软正通过MDASH广泛提供其模型,该公司表示该平台已包含超过100个由行业专家调优的代理。

成本声明值得审视。微软将新系统与自身此前的最佳方案进行比较,而不是与竞争对手比较。如果竞争对手模型如Mythos或Gemini 3.5 Flash Cyber提供更低的绝对价格,那么在一个昂贵的基准线上节省50%仍然高昂。该公司没有公布独立的MAI-Cyber-1-Flash定价,只有系统级数字。博文中承诺的技术报告可能会澄清这些数字,但尚未公开。

微软还推出了Perception,一个使用代理团队进行持续监控和修补的自主安全系统,扩展了MDASH的软件漏洞重点。Perception很快将在许多工作流程中使用MAI-Cyber-1-Flash,这标志着微软打算让该模型成为其安全产品线中的默认主力。

真正的考验将来自安全团队运行自己的基准测试。一个在CyberGym上得分高的模型可能无法推广到每个企业的代码库或威胁场景。微软声称MAI-Cyber-1-Flash是使用最高质量的数据在内部从头构建的,但第三方验证比营销更重要。没有它,96%仍然只是一个幻灯片上的数字。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。