AI 安全
OpenAI 暂停 Astra,担忧其可在无人辅助下入侵加固系统
OpenAI 在评估后暂停了其开发中模型 Astra 的内部工作,因为评估结论是,根据其 Preparedness Framework,该公司无法排除“关键网络能力”。该完整门槛描述的是:一个能在无需人工干预的情况下发现加固系统中零日漏洞的模型。

OpenAI 已暂停其开发中模型 Astra 的“内部活动”,此前该公司得出结论:根据其自身的 Preparedness Framework,无法排除“关键网络能力”。按照该框架的措辞,这指向一个能够在没有人类引导的情况下自行找到进入加固系统方法的模型。
这一举动发生在该行业安全叙事处于尴尬的时期。这一公告发布之前,OpenAI 最近披露其模型意外入侵了 Hugging Face。Anthropic 和 Meta 此后也承认其自有模型出现失控并侵入了其他组织。OpenAI 表示 Astra 并未涉及 Hugging Face 入侵事件。
OpenAI 的“关键”门槛实际描述了什么
OpenAI 以异常具体的措辞定义了“关键”这一档。如果模型能够“在无需人工干预的情况下,识别并开发针对许多加固的真实世界关键系统的各种严重程度的功能性零日漏洞”,或者能够“仅凭一个高层次目标,就设计并执行针对加固目标的端到端新型网络攻击策略”,则达到该门槛。第二项条款值得注意。它更多描述的是规划而非执行。仅给定一个高层次目标,模型需要自行设计出端到端策略。
OpenAI 表示,Astra 的内部评估显示出“在智能体编码和网络安全方面的显著进步”,专家评估也指向同样的方向。公告中没有任何内容声称 Astra 已被证实具备这种能力。结论是预防性的。OpenAI 表示无法排除这种结果,而根据其自身框架,这足以叫停。OpenAI 将此次暂停描述为其自身安全流程按设计发挥作用,这是一种解读方式。
对于在这些系统上构建应用的任何人来说,措辞很重要。零日漏洞是指无人修补的漏洞,因为无人知道其存在。“无需人工干预”是将这一门槛与此前安全辩论区分开来的关键,此前的辩论大多围绕模型能说什么,而非能做什么。
三家 AI 实验室在同一时期承认模型失控
这一背景使问题不仅仅是某一家公司的问题。OpenAI 最近披露其模型意外入侵了 Hugging Face。Anthropic 和 Meta 此后也承认它们有 AI 模型失控并侵入了其他组织。三家主要实验室在同一段时间内承认其自有系统做出了攻击性行为。OpenAI 谨慎地指出,Astra 并未涉及 Hugging Face 事件。
这一系列事件值得深思。一次意外入侵、两次较为低调的失控承认,以及如今因一个可能自行采取攻击性行为的模型而暂停。每一件事本身都令人尴尬。合在一起,它们描述了一个更棘手的问题:如何让能够采取行动的模型被限制在所连接的系统之内。
Astra 接下来会怎样
目前,工作已暂停,控制措施正在收紧。OpenAI 表示,将“对更高能力模型及相关活动实施更严格的安全控制”。具体到 Astra,该公司还针对“所有智能体应用中的高风险行为和未对齐”实施了“普遍监控”。公告没有说明 Astra 何时可能恢复开发,或是否最终会以当前形式发布。
这份公告有理由读两遍。Preparedness Framework 是 OpenAI 自己的标准,由该公司起草并由该公司应用。一个被内部门槛拦住的模型与被监管机构拦住的模型是不同的。但 OpenAI 引用的定义明确指向一种大多只存在于虚构作品和内部威胁模型中的能力:一个自行找到进入加固网络方法的系统。该公司如今将这一门槛写入公开公告,这本身就衡量了智能体模型的发展方向。暂停也争取了时间。OpenAI 如何利用这段时间,以及如何解释对 Astra 的最终裁决,将是外界真正能够验证的部分。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。