SevenTnewS

人工智能

四个智能体胜过一个:ARCANA通过自我对话破解ARC-AGI-2

多家机构的研究人员提出了ARCANA,一个将ARC-AGI-2谜题分解为感知、假设生成、符号执行和反思优化的多智能体系统。其模块化架构和学习型元控制器提升了推理效率,但论文中关于泛化能力和计算成本的关键问题仍未解答。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-19 · 阅读需 4 分钟

四个智能体胜过一个:ARCANA通过自我对话破解ARC-AGI-2
来源 : arXiv:2607.0905…

ARC-AGI-2基准测试曾让众多AI系统折戟。该测试旨在用极少的示例检验抽象视觉推理能力,要求具备类似流体智能的灵活性,而即使是最大的Transformer模型,仍难以企及。ARCANA应运而生,这是一个全新的协作式多智能体框架,它将问题视作团队协作,而非单一模型的挑战。

ARCANA带来了什么

ARCANA(全称为反思性多智能体程序合成)将解谜流程重组为四个专门的智能体。首先,感知接地智能体从原始像素网格构建面向对象的场景图。接着,潜在程序策略提出多种DSL(领域特定语言)程序,用以将输入网格映射到输出网格。然后,符号执行器针对提供的示例验证每个候选程序。最后,反思智能体分析执行失败原因,并合成反馈以引导下一轮迭代。

这些智能体并非孤立运行:它们通过一个共享的可微分黑板进行通信,而一个学习型元控制器决定何时调用哪个智能体。这种架构使ARCANA能够将结构化程序搜索与自适应多轮修正相结合,论文作者认为,这种混合方法相比端到端的神经网络方法更具样本效率。

为何ARC-AGI-2如此棘手

ARC-AGI-2基准测试由François Chollet创建,专门用于衡量系统从少量示例中泛化的能力。每个谜题提供少量输入-输出网格,展示一种抽象变换,例如颜色填充、对象旋转、镜像操作等,模型必须推断出规则并将其应用于新网格。这本质上是对流体智能的测试,而非知识记忆。

大多数大型语言模型和视觉Transformer在ARC-AGI-2上表现仍然不佳,常常无法从稀疏数据中恢复出底层规则。相比之下,ARCANA将其显式分解为感知、假设、执行和反思,这正模仿了人类解谜者的方式:观察、猜测、验证和修正。

反思性反馈循环或许是最具创新性的组件。当符号执行器拒绝某个候选程序时,反思智能体不会简单地丢弃它。相反,它会合成一个用自然语言描述的解释,说明程序失败的原因,而假设智能体则利用该解释在下一轮提出修订后的程序。这种循环式优化类似于思维链推理,但应用于程序合成而非文本生成。

结果与未解问题

论文报告称,在具有挑战性的抽象变换任务上,推理效率和解的质量均有提升,但本文未复现精确的数值结果。完整评估将在预印本发布时公开。作者还指出,严格的时间和硬件限制是设计的驱动因素,暗示ARCANA相比在指数级程序空间上进行暴力搜索,更注重资源效率。

尽管如此,仍有几个问题悬而未决。黑板通信架构依赖于学习型元控制器,其训练流程和数据需求在摘要中并未详述。此外,尚不清楚该框架的性能是否能迁移到其他注重推理的基准测试上,还是这些改进仅适用于ARC-AGI-2的谜题结构。尽管论文提到了“多样的DSL程序”,但DSL本身的大小和丰富程度将严重影响问题复杂度的上限。

这种方法与更广泛的行业趋势一致:许多前沿实验室现在正构建复合AI系统,将子问题路由到专门的模块,而不是将所有推理塞入单一模型。Google DeepMind已尝试将模块化智能体用于代码生成;OpenAI的Q*项目据称将数学问题分解为子目标。ARCANA是这一运动的一部分,但它更进一步,通过执行到假设形成的反馈闭环来完善。

对于实践者而言,该框架提供了构建透明、可调试AI系统的潜在模板。如果ARCANA的智能体在某项任务上失败,反思智能体生成的以自然语言等形式的失败总结,可为人类操作员提供具体的干预点。这种可追溯性在单一神经网络模型中非常罕见。

但真正的考验在于规模和多样性。ARC-AGI-2是一个精心策划的竞赛;现实世界会带来更杂乱的抽象。ARCANA的四个智能体协作是否能应对,比如说,医疗诊断流程或物理机器人的感知循环,仍有待观察。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。