人工智能经济学
Claude vs Fugu 成本核算:当集群胜过单一模型
Anthropic的Claude Opus 5以一半的令牌成本提供接近旗舰的性能,但有意限制了网络安全能力。Sakana AI的Fugu平台编排多个开源模型以匹配前沿基准。决策取决于任务类型、预算和对复杂性的容忍度。

今年夏天最有意思的人工智能定价问题,不是哪个模型在基准排行榜上领先。而是像 Anthropic 的 Claude Opus 5 这样单个精良的模型,与 Sakana AI 的 Fugu 平台协调的一群模块化开放模型,哪个能为你带来更多价值。答案取决于你实际在构建什么,根据 Claude Opus 5 的基准测试结果。
成本与性能的权衡
Anthropic 的 Claude Opus 5 在编码和知识基准测试中几乎与其旗舰模型 Fable 5 相当,而每 Token 成本降低 50%。仅此一点就使其成为通用工作的强大默认选择,这一动态与 LiveBench 排行榜上看到的成本动态 密切相关。但如果考虑到 Claude Sonnet 5, , Anthropic 将其设为免费和 Pro 计划的默认模型, , 情况就变得更加复杂。Sonnet 5 的定价为每百万输入 Token 2 美元(有效期至 2026 年 8 月),在自主浏览和多步推理等代理任务上缩小了与 Opus 级模型的差距。对许多团队来说,更便宜的 Sonnet 可能已经足够。
另一方面,Fugu 并不出售单一的模型。它出售的是对编排层的访问权限,该编排层能够选择、组合并在多个专门化的开放权重代理之间路由任务。计费基于使用量,且与提供商无关。Sakana 认为,模型选择应该是路由器的问题,而不是开发者的问题。这一理念意味着你可以随着新模型的出现而更换,而无需重新协商订阅,但这也意味着你需要为开销付费, , 编排本身会增加每次请求的延迟和成本。
网络安全盲点
Anthropic 默认启用了 Claude Opus 5 的网络安全保护措施。该公司将其定位为安全特性,但它也是一种刻意的能力限制。如果你的工作涉及漏洞研究、红队测试或攻击性安全工具,Claude 会阻止或拒绝 Fugu-Cyber 能够轻松处理的任务。根据 Sakana 的公告,Sakana 的 Fugu-Cyber 多智能体系统在关键基准测试上与 GPT-5.5-Cyber 和 Mythos-Preview 等前沿网络安全模型相当。这呼应了一个更广泛的模式:前沿网络安全评估揭示了即便是最大模型中也存在盲点。
Claude 确实有一个专门用于网络安全的变体, , Claude Mythos 5,其出口管制已于 2026 年 7 月对美国客户解除。但 Mythos 不在标准的 Opus 定价范围内,需要专用账户。对于需要将网络安全能力内置到通用订阅中的团队,Fugu-Cyber 提供了一条更集成的路径。
多智能体编排:灵活性 vs 控制
Fugu 的集群方法从模块化中获得力量。它与 NVIDIA 的 Nemotron 系列合作,增加了在编码、工具调用和指令遵循方面表现突出的专门化模型,这一设计在 Sakana 对 Nemotron 模型的整合 中有详细描述。该系统会反馈性能数据,以改进编排层和模型本身。如果一个智能体表现不佳,路由器可以将工作转移到另一个,而用户不会察觉。这种提供商无关性对于希望避免供应商锁定或需要在自托管模型上运行敏感工作负载的组织来说很有吸引力。
相比之下,Claude 提供了一个稳定的单一模型生态系统。你支付可预测的订阅费用,获得一致的 API,无需管理路由逻辑。对于重视可靠性超过可选性的团队来说,这种简单性具有实际的运营价值。Anthropic 将 Sonnet 5 定位为迄今为止最具代理能力的 Sonnet 模型,能够自主规划和执行复杂的多步骤任务。早期测试者描述,该模型能在前辈停滞的地方完成,无需干预即可自我纠正输出。这种自主性减少了组装独立代理工具链的需求,这一发现与近期关于代理中自监督学习的研究相一致。
决策框架:何时续约,何时切换
没有一个答案适合所有团队。选择归结为三个变量。对于网络安全任务,Fugu-Cyber 提供具有基准竞争力且没有能力限制的能力,而通用编码和代理自动化可以依赖每百万 Token 2 美元的 Claude Sonnet 5。预算结构也很重要:Claude 订阅提供可预测的月成本,而 Fugu 的按编排付费模式对于突发工作负载可能更便宜,但对于稳定使用更难预测。最后,供应商风险承受能力也会起作用:希望独立于任何单一提供商,或者需要在自己的基础设施上运行模型的组织,会发现 Fugu 的模块化架构更具兼容性。而偏好单一关系和经过验证的 API 的团队则会坚持使用 Claude。
最强烈的信号可能来自发展趋势:Claude Sonnet 5 在代理任务上缩小了与 Opus 的差距,而 Fugu 不断添加专门的智能体。单一模型与集群之间的差距正在从两侧缩小。对于大多数企业来说,问题不在于哪个单独更好,而在于哪个更适合他们已有的工作流程。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。