SevenTnewS

网络防御

Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案

Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-21 · 阅读需 5 分钟

Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案
来源 : Sakana AI offic…

关于前沿AI模型是否已准备好投入生产以保护网络的辩论正达到新的高度。一方面,供应商推动叙事,认为访问一个强大的模型是企业安全的万能药。另一方面,实践者则指出部署失败、误报和集成差距的问题。

以Fugu编排模型闻名的Sakana AI刚刚发布了一个专为网络防御打造的版本。Fugu-Cyber在CyberGym上达到了86.9%,该基准测试衡量代理分析复杂代码库和验证真实世界漏洞的能力;在CTI-REALM上达到了72.1%,该基准测试衡量模型将原始威胁情报转化为可工作检测规则的能力。这些分数与领先的网络专注型前沿模型GPT-5.5-Cyber和Anthropic的Mythos-Preview持平。

这一公告不仅仅是基准测试的发布。它是对Sakana所称的关于前沿模型网络能力的“恐吓营销”的一次精确回击。

基准测试背后的编排模型

与原始的Fugu一样,Fugu-Cyber是一个多代理系统,表现为单个API端点。用户发送请求,系统内部为不同子任务启动专门的代理。这种设计旨在避免对单一供应商的依赖,同时仍然提供看起来像来自一个模型的输出。

Sakana正在以Token计划提供该API,并设置了一个访问控制门:感兴趣的用户必须提交一个请求表单,说明其使用案例并提供已验证的联系方式,公司在授予访问权限前会手动审核这些信息。更新的可接受使用政策禁止攻击性误用。

Sakana希望行业进行现实检查

Sakana自己的评论削弱了简单的推销。该公司引用了最近的一份日经数字治理报告,发现日本大型金融机构经常难以将前沿模型投入运营,即使这些模型具有最先进的网络推理能力。报告总结说,如果没有专门的内部人才和与专有代码的深度集成,一个强大的模型本身无法可靠地发现或修补漏洞。

示意图:Fugu-Cyber部署工作流程
如文章所述,Sakana的Fugu-Cyber使用多代理系统,结合人工审查和企业集成,以弥合基准能力与生产可靠性之间的差距。

Sakana的应用企业团队从与主要日本企业的合作中也得出了同样的教训。孤立部署的原始模型会产生误报。它们会错过真实生产环境的上下文。它们需要约束框架和验证工作流程。

“一个具有强大网络推理能力的高能力API是拼图中一个极其重要的一块。但它不是完整的解决方案,”该公司在其发布中写道。

这种表述值得注意,因为它来自模型提供商本身。大多数供应商在基准测试分数前就会止步。Sakana反而在描述售后工作:构建专门的基础设施,使模型在生产中安全可靠,包括人工参与和子代理,在建议补丁之前验证每个潜在的漏洞。

企业差距

模型能力与可部署性之间的张力并不新鲜。OpenAI的GPT-5.5网络安全评估显示了漏洞发现能力的显著提升,但这些提升的实际影响完全取决于组织如何将模型集成到其现有的检测和响应管道中。Google DeepMind的Gemma 4红队测试同样发现,即使是一个强大的模型,在敏感环境中被信任之前,也需要特定领域的审查。

Sakana试图通过将Fugu-Cyber定位为更大企业解决方案的一部分,而不是一个独立产品,来短路典型炒作周期。该公司认为,真正的价值来自于将模型的推理与深厚的本地安全专业知识和严格的验证工作流程相结合。

基准测试究竟衡量了什么

CyberGym和CTI-REALM针对网络安全中重要的两种不同能力。CyberGym测试代理是否能彻底理解代码库,以检查已知的漏洞模式,这需要广泛的代码理解和安全特定知识。CTI-REALM测试另一个方向:给定为人类分析师编写的威胁情报报告,模型能否生成一个系统可以实际运行的检测规则?

这两项任务都是多步骤的,并且需要超越模式匹配的推理。在这些基准测试中达到70多或80多的分数是一个严肃的结果。

但Sakana自己的现实检查意味着,即使是很高的基准测试分数,也只是有效网络防御的必要条件,而不是充分条件。基准测试成功率与可靠生产部署之间的差距仍然很大,以至于Sakana建立了一整个企业团队来弥合它。

主权论点

该公司还将其方法与“AI主权”联系起来,这个术语在那些担心将安全基础设施依赖外国前沿模型的企业市场中尤其能引起共鸣。通过将多个模型编排成一个统一系统,并通过本地专业知识进行部署,Sakana将Fugu-Cyber定位为一种将敏感工作流程保持在可信边界内的方法。

这一论点可能在日本非常受欢迎,Sakana总部设在日本,其首批企业部署也正在那里进行。

底线

Fugu-Cyber是一个真正强大的网络推理模型,其基准测试分数使其与OpenAI和Anthropic的产品处于同一级别。但与此同时,对“模型将修复安全”叙事的回击既不同寻常,也值得欢迎。Sakana基本上是在告诉自己的客户,光有模型是不够的,他们需要合适的人员、流程和集成工作才能使其发挥作用。

行业其他公司是跟随这一领导,还是继续将前沿模型访问作为独立解决方案销售,将决定这些能力有多少能真正进入生产网络。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。