SevenTnewS

AI安全

Claude Fable 5生物学回退减少85%,Anthropic放宽防护

Anthropic在重新训练其安全分类器后,将Claude Fable 5的生物学相关回退减少了约85%。普通健康和教育查询现在更常到达完整模型,但病毒学、毒理学和分子设计仍路由至Opus 5。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-10 · 阅读需 4 分钟

Claude Fable 5生物学回退减少85%,Anthropic放宽防护

Anthropic放宽了Claude Fable 5的生物学防护措施,这一变化体现为一个数字:在公司的测试中,生物相关回退减少了约85%。回退是指请求触发安全分类器并被重新路由到Opus 5(一个能力较强但生物学能力较弱的模型)时发生的情况。对于请Fable 5解读化验结果、解释症状或教授生物学的用户来说,这类重定向现在应该不常见了。

扩大访问权限的推动是有意为之。Anthropic认为,AI惠及世界的最大机会在于生物学和医学,并表示正在大力投资,以负责任的方式为生物学家提供前沿访问权限。分类器更新是该计划的一半;高风险能力的可信访问路径是另一半。

该公司直截了当地说明了这为何不仅仅关乎便利。其能力评估表明,Fable 5在一些高度复杂的生物任务上可以超越专家,并在其他任务上提供操作支持。它警告说,同样的能力可能为恶意行为者开发生物武器提供“显著提升”,带来“他们在其他任何地方都找不到的能力”。

为何普通生物学问题在发布时被拦截

Fable 5发布时几乎所有生物学查询都被拦截。Anthropic认为双重用途风险太高,只能如此,并选择在其他领域开放该模型,同时其安全工作也在跟进。Fable 5与双重用途的Claude Mythos 5是同一个基础模型,后者通过严格审查的可信访问计划发布,正如我们的发布报道所涵盖的那样。将模型推迟数周或数月会完全延迟普通访问。

图表 : 总回退预期降幅
据文章报道,Anthropic估计分类器重训练使Claude.ai、Cowork、Claude Code和Claude Platform的总回退分别减少67%、55%、17%和7%。

这种姿态是有代价的:大量误报。提出普通生物学问题的用户被转到一个能力较弱的模型。该公司称这种权衡是有意为之,因为在生物学这样的双重用途领域,滥用的代价可能是灾难性的。

在这一领域,有益和有害的用途往往难以区分。研究一种治疗方法可能需要制造导致疾病的危险化合物。活疫苗需要培养它们所预防的同一种病原体,而降压药卡托普利来自使血压骤降的毒蛇毒液成分。想要滥用该模型的行为者知道如何利用这种模糊性,使危险任务看起来像普通研究。

分类器是如何被重新训练的

防护措施依赖于安全分类器,即较小的自动化系统,用于检测Fable 5是否被要求执行受保护的生物学任务或产生有害输出。当分类器触发时,请求会被重新路由到Opus 5。调整这些系统意味着在减少误报的同时不产生漏报,并保持其对越狱的抵抗力。

在过去几周里,Anthropic重写了分类器的“章程”, , 即区分范围内与范围外内容的规则, , 详细列出了良性用途。重写经过了内部和外部专家审查。随后是新的训练数据,分类器被重新训练,公司验证了它仍然会对有害和双重用途的研究内容触发,同时放行更多良性请求。

据公司估计,重新训练还减少了整个产品线的总回退:

产品表面总回退预期降幅
Claude.ai67%
Cowork55%
Claude Code17%
Claude Platform7%

保持不变的上限

Anthropic的帖子引用了美国情报界2026年度威胁评估,该评估警告说,生物技术的进步,包括合成生物学和基因组编辑,“可能导致新的生物威胁”,并指出多个国家行为体可能维持着现役的进攻性生物和化学武器计划。帖子补充说,这些计划可能因获得前沿AI能力而加速。

这种风险权衡解释了哪些内容没有改变。被视为双重用途的请求,包括病毒学、毒理学和分子设计,仍会回退到Opus 5。Fable 5尚不能用于专业生物学研究和药物开发。Anthropic表示,它致力于通过面向经审查研究人员的可信访问路径来弥合这一差距。

85%这个数字是Anthropic自己的测量结果,来自更新到达用户之前。分类器的新边界能否在现实压力下保持,是悬而未决的问题;公司预计仍会存在一些误报。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。