前沿AI
Anthropic 最聪明的 Claude 是你无法使用的那一款
Anthropic 向所有人推出了 Claude Fable 5,并将 Claude Mythos 5 保留给经过审核的合作伙伴。同一模型系列,两扇访问之门。基准测试不如路由机制重要,而路由正是前沿 AI 从今往后的发布方式。

Anthropic 于 2026 年 6 月 9 日发布了两款 Claude 5 模型。同一个基础模型系列,两款产品,两扇门。
Claude Fable 5 是公开版本,定价为每百万输入 token 10 美元、每百万输出 token 50 美元。Claude Mythos 5 则仅限于 Project Glasswing 合作伙伴、政府合作方以及未来的可信访问计划。BenchLM 的映射数据显示,两款模型均位列 Anthropic 当前排行榜之首,领先于 Claude Opus 4.8 及周边 GPT 与 Gemini 系列。分数是最简单的部分,真正有意思的是 Anthropic 围绕模型构建的一切。
两个月前,这一模型系列的能力过强,不适合广泛发布。Anthropic 当时就是这么说的。如今它还是发布了,只不过某些请求永远无法触及它。Fable 5 在网络、生物、化学和蒸馏任务上保留了安全防护;在部分 Claude 客户端中,高风险请求会被路由至 Claude Opus 4.8,而在 Messages API 中,除非开发者选择启用回退,否则这些请求将被阻止。Anthropic 表示,路由机制应只影响不到 5% 的会话。公开产品不再只是一个模型。它由模型加分类器、路由策略、回退机制与访问制度组成。前沿 AI,正如我们的发布分析所言,正在变成能力路由,而非一个通用端点。
两款产品,同一模型系列
Anthropic 将 Fable 5 描述为面向通用用途而做安全化处理的 Mythos 级模型,在软件工程、知识工作、视觉、科学研究和长时间运行任务方面表现最强。它通过 Claude API 以及包括 Amazon Web Services、Google Cloud 和 Microsoft Foundry 在内的主要云市场以 claude-fable-5 的名称提供。缓存输入 token 可享受 90% 折扣;仅限美国地区的推理按标价的 1.1 倍计费。
按照 Anthropic 的说法,Mythos 5 是同一个基础模型,只是为经过审核的用户解除了部分限制。差异在于部署方式,而非智能水平。
| 产品 | 能力 | 访问方式 | 安全态势 |
|---|---|---|---|
| Claude Fable 5 | Mythos 级 | 全面开放 | 安全防护加回退或阻止 |
| Claude Mythos 5 | Mythos 级 | 经审核的可信访问 | 敏感工作解除部分限制 |
多年来,一个模型名称意味着统一的能力表面。Fable 和 Mythos 打破了这一点。同一种智能如今以多种产品形态呈现,并附带不同的政策,而路由机制本身也成为发布的一部分。
基准测试实际说明了什么
下面每一行数据都附带一个提醒:大部分由 Anthropic 自行发布,发布首日独立第三方的验证很少。请将这些数字视为严肃数据,而非最终定论。
| 模型 | 综合 | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.1 | OSWorld-Verified | 输入/输出价格 |
|---|---|---|---|---|---|---|
| Claude Mythos 5 | 99 | 95.5 | 80.3 | 88.0 | 85.0 | 受限 |
| Claude Fable 5 | 96 | 95.0 | 80.0 | 84.3 | 85.0 | $10/$50 |
| Claude Opus 4.8 | 93 | 88.6 | 69.2 | 74.6 | 83.4 | $5/$25 |
| Gemini 3.1 Pro | 90 | 75 | 72 | 77 | 76.2 | $2/$12 |
| GPT-5.5 | 89 | - | 58.6 | 82 | 78.7 | $5/$30 |
SWE-bench Verified 的 95.5 和 95.0 已接近当前公开编码基准的天花板。SWE-bench Pro 是更能说明问题的一行,因为它难度更高、饱和度更低。Terminal-Bench 2.1 展示了安全防护层的代价:Mythos 达到 88.0,公开版 Fable 为 84.3。OSWorld-Verified 并列 85.0。
真正重要的差距在于智能体能力。SWE-bench Pro、Terminal-Bench 和 OSWorld 都在问同一个问题:当成功需要大量微小决策时,模型能否让一个庞杂项目持续推进?这正是 Fable 级系统相对于其他同类模型拥有真正提升空间的地方。
从四月的克制到六月的路由
四月时,Mythos 的故事是克制。该模型在编码和智能体基准测试上大幅领先 Claude Opus 4.6,而 Anthropic 选择不发布它。原因是务实的。一个擅长编码、推理和工具使用的通用模型,同样擅长发现漏洞,而一旦模型足够强大,防御性与攻击性研究之间就不再存在清晰的界线。
Fable 5 是 Anthropic 给出的答案。它没有等待完美的安全防护,而是拆分部署。风险并没有消失,而是转移进了产品架构。将最强大的模型一分为二改变了 AI 的部署方式,而 Anthropic 并非孤例:OpenAI 以半价预览了 GPT-5.6 Sol、Terra 和 Luna,仅限约 20 个政府批准的合作伙伴使用。两次发布之间间隔的 17 天是判断 2026 年市场走向最清晰的信号。
模型之下的自主性叙事
Fable 最重要的主张与聊天无关,而是关于长时间运行的工作。Anthropic 的发布公告引用了 Stripe 的说法:Fable 帮助在约一天内迁移了一个 5000 万行的 Ruby 代码库,而内部人工估计需要约两个月。供应商的轶事值得怀疑;它们是为追求最大冲击力而挑选出来的。但这一方向仍与基准测试的画像相符。
Ethan Mollick 在 One Useful Thing 上的抢先体验文章展现了这种转变的实际感受。他在网络安全领域之外测试了 Fable。该模型从模糊的提示中构建出可玩的游戏,在没有任何图像生成器可用的情况下,通过代码和数学生成了美术与 3D 资产。它派生出子智能体去收集航班时刻、铁路数据和道路车速,同时自己继续编写代码,从而生成了一幅等时线地图。它连续运行了九个半小时,构建了 Concord, , 一个用于跨研究数据集校准人类与 AI 判断的工具。结果并不完美,Mollick 发现了错误和缺口。但其规模超出了他从早期模型中见过的水平,他将收尾工作描述为工程师可以完成的工作,而非应该丢弃的项目。
工作流程也随之改变。专家不再监督每一个步骤,而是开始委派工作、审查产物、修正结果。Mollick 最强烈的担忧在于代价:运行时间越长,过程就越不可见。数百个微小决策在无人注视的情况下发生,然后被融入输出。模型获得了杠杆效应,而人类仍然承担后果。
对买家而言,衡量标准从每百万 token 的美元价格,转向每个完成并经审查的任务的成本。一个 token 价格翻倍的模型,如果需要的重试更少、人工修补更少,依然可以胜出。对其他人来说,结构性解读更为重要。模型变得更好了,围绕它的边界也变得更重要。大多数用户永远不会接触到 Claude Mythos 5;他们得到的将是同一智能的路由化、受防护版本,而在这个边界内工作,如今已成为使用前沿模型的一部分。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。