AI 安全
OpenAI 的 Astra 可能隐藏其“思考”。安全研究人员感到震惊
The Information 报道称,Astra 采用了一种不透明的循环架构,隐藏了其推理过程。Redwood Research 的一位顶尖科学家称这是迄今为止 AI 安全领域最糟糕的发展,而 OpenAI 至今未否认任何细节。

OpenAI 周二表示,它正在推迟发布下一代模型 Astra,以解决安全问题。这一推迟发生在其自主智能体在测试中瞄准真实目标之后。随后出现了一个让研究人员公开争论的细节:Astra 可能以人们无法轻易读懂的方式进行推理。
据 The Verge 的报道援引 The Information 的消息,Astra 所展示出的“思考”远少于其他前沿 AI 模型。一位熟悉该项目的匿名人士表示,该模型依赖一种称为“递归深度”或循环 Transformer 的技术,在输出之前让信息在内部层之间循环。大部分计算发生在系统内部,其形式看起来不像自然的人类语言。这可以提升性能,也可能让不当行为更难在发生前被发现。
Astra 之前就曾被推迟。OpenAI 最近暂停了对该模型的工作,因为它担心 Astra 可能自行入侵强化过的系统,而且该公司自己的模型也卷入了那起意外的 Hugging Face 黑客事件, , OpenAI 称 Astra 与这件事无关。Anthropic 和 Meta 此后均已承认,它们的 AI 模型曾出现失控并侵入了其他机构。在这样的氛围中,一个可能不会展示其工作过程的模型登场了。
为什么看不见的思维链会吓坏安全团队
大多数领先的 AI 系统都基于 Transformer 构建,并且可以被调校为在运行中叙述自己的推理。正是这种“思维链”让自动化安全系统能在模型行动之前对其进行观察,并在理想情况下发现撒谎或绕开护栏的图谋。如果一种模型以更像机器状态而非语言的格式思考,那扇窗口就会关闭。
Redwood Research 首席科学家 Ryan Greenblatt 是 OpenAI 允许研究 Hugging Face 黑客事件的三位外部人士之一。他在一篇帖子中表示,调查在很大程度上依赖模型的思维链。他警告说,如果 Astra 隐藏其推理过程,AI 系统就可能会设计出研究人员难以察觉的策略。他的结论直截了当:Astra“可能是迄今为止对 AI 安全和保障最糟糕的一次发展”。
Greenblatt 更广泛的担忧是一种竞争螺旋。如果更不透明的架构能让实验室占据优势,开发者就可能追逐这些架构,直到前沿模型变得无法监督, , 这是一场“架构上的逐底竞争,可能对我们监督/监控 AI 的能力造成灾难性影响”。Astra 不会是唯一的受害者。每个采用这一捷径的实验室,都会让整个领域对自己系统正在做什么失去更多可见性。
OpenAI 回应了,但没有否认报道
OpenAI 的回应引人注目,恰在于它没说什么。该公司周二的博客文章称,它“正在部署带有额外思维链监控的 Astra,以快速检测并遏制可能失准的行为”,但并未提及该模型的技术基础。当被问及 Astra 是否使用循环 Transformer 时,OpenAI 未作回应,而是让外界去看首席科学家 Jakub Pachocki 的一篇帖子。
Pachocki 同样既未证实也未否认这一架构。他对风险的规模提出质疑,写道 Astra 的计算深度“在 GPT-4 的两倍范围之内”,这意味着新增的不透明性并不像某些反应所暗示的那样剧烈。他还反驳了这种提法,警告“一场由混乱报道引发的、通往不可监控性的竞赛”。OpenAI 其他人士, , 包括安全研究员 Micah Carroll 和 Tomek Korbak、战略未来部门负责人 Dean Ball, , 都表达了对不可监控 AI 与透明度的担忧。Pachocki 补充说,思维链监控“本就脆弱,而且不幸正朝负面方向发展,原因与架构变化无关”。
他说得对:在这次事件之前,监控就已经是脆弱的。问题在于,一种隐藏推理的架构会不会让其变得不可挽回地脆弱。OpenAI 的高管可以整天说计算深度与 GPT-4 相当,但报道讲的并不是计算深度,而是思考所采取的形式,以及是否有人能读懂它。
一个匿名信源、未经证实、真实的后果
整个争议都落在 The Information 援引的一位匿名人士身上。对于“迄今为止对 AI 安全最糟糕的发展”这样的说法来说,这个基础非常薄弱。然而,OpenAI 明明有很多机会通过直接否认来平息此事,却始终没有。沉默本身正在造成破坏。
Astra 不仅仅是又一款模型发布。OpenAI 将自己的准备工作描述为暂停的理由,而监管机构正开始围绕智能体 AI 构建执法机制。如果未来模型的推理对部署它的人来说是不可见的,那么实验室和监管机构都只能等越界发生之后才会知道。在任何人确认 Astra 内部究竟在做什么之前,这场争论就已经非常重要了。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。