AI模型
Claude Opus 5以一半成本达到接近前沿的性能,但在网络安全上故意留出盲点
Claude Opus 5发布,在编码和知识基准测试上获得接近Fable水平的分数,价格却只有一半。但其故意削弱的网络安全能力为开发者带来了明确的取舍。

Claude Opus 5今天正式发布,其数据令人瞩目。在Frontier-Bench v0.1上,该模型超越了所有其他测试模型,在每任务成本更低的情况下,分数是其前代Opus 4.8的两倍多。在CursorBench 3.2上,它的得分与Fable 5的峰值相差不到0.5%,而每任务成本只有一半。在衡量解决新问题能力的ARC-AGI 3评估中,Opus 5的分数是次优模型的三倍。
定价与Opus 4.8保持不变:每百万输入token 5美元,每百万输出token 25美元。这使得接近前沿的智能以Fable 5价格的一小部分即可获得,成为Claude Max的默认模型和Claude Pro上最强的模型。
但这些亮眼的数字也伴随着一个警告。Anthropic有意训练Opus 5,避免其提升进攻性网络安全能力。该模型发现漏洞的比率接近其专注于网络安全的兄弟模型Mythos 5,但很难将这些漏洞转化为可用的利用代码。在OSS-Fuzz基准测试中,Opus 5和Mythos 5识别bug的速率相似,但Opus 5的利用开发分数远远落后。
这是有意为之。Anthropic在Opus 5上的安全分类器阻止了基于二进制的漏洞扫描、渗透测试和利用生成。被标记的请求默认回退到Opus 4.8,企业可以通过网络安全验证计划访问限制较少的版本。
| 基准测试 | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| Frontier-Bench v0.1 | 最佳(超越所有) | 低于Opus 5 | 不到Opus 5的一半 |
| CursorBench 3.2 | 与Fable 5相差不到0.5% | 峰值 | 较低 |
| ARC-AGI 3 | 是次优模型的3倍 | N/A | 较低 |
| Zapier AutomationBench通过率 | 同等成本下是次优模型的1.5倍 | N/A | 较低 |
| OSS-Fuzz利用开发 | 远落后于Mythos 5 | N/A | N/A |
在实际使用中,早期测试者描述这个模型会先思考再行动。一家交易公司的工程师使用Opus 5在一个会话中为一家新交易所构建了市场数据源,而之前的模型即使在大量指导下也无法完成。另一位测试者让Opus 5担任其开发环境的幕僚长,该模型构建了自己的监控器并独立驱动每台机器。
该模型还展现出更强的自我验证能力。在接到一个无法直接查看绘图的任务时,它自己编写了计算机视觉流水线,从原始像素中提取几何图形。当被要求修复一个流行包管理器中的bug时,它找到了根本原因,并修补了社区自己的修复方案遗漏的一个边缘情况。
在生物学和科学研究方面,Opus 5相比Opus 4.8有明显的升级,在生命科学评估中全面改进,尤其是有机化学和蛋白质相关任务。然而,在长时间自主研究任务上,它仍然不如Mythos 5,Anthropic指出这是生物学应用中风险最高的领域。
Anthropic还在发布的同时引入了两个功能:Claude平台上的会话中工具更改(允许开发者更改工具而不使提示缓存失效),以及API上的自动回退(被标记的请求路由到另一个模型而不是被阻止)。
对于在Opus 5和Fable 5之间做选择的团队,计算很简单:Opus 5以一半的成本提供了Fable的大部分推理能力,但你会失去在网络安全任务和一些最难的自主研究方面的优势。对于大多数编码和知识工作,它是更好的日常选择。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。