研究
六字诀:干扰、验证、代理, , AI智能体探索与安全的新解法
一种新颖的异质智能体群体架构将发散性探索、运行时安全把关和跨领域知识检索分离为专业角色。干扰者负责生成高熵提案,验证者在工具调用网关处执行硬约束检查,代理者通过对比新颖性检索引入域外类比。执行失败被编译为带签名的约束补丁,称为“疤痕”,供后续世代缓存复用。评估显示,该群体实现了95%的远程目标发现率、零次已执行违规行为,并因疤痕机制节省了15.1%的令牌成本,在资源受限条件下通过信用分配的带宽机制实现了55.9%的成本降低。

多年来,自主AI智能体领域一直面临一个令人不安的权衡:让它们自由探索就会闯祸;严格约束它们则永远找不到有趣的东西。刘腾蛟的最新预印本《异质智能体群体:具有运行时约束记忆的安全开放式探索》(Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory)为这种二元对立提供了一种刻意的解法。
该论文并未让单一模型同时兼顾创造力和谨慎性,而是提出了一种三角色智能体群体,将关注点分离开来。一个干扰者负责生成非常规、高熵的提案,即那些单一智能体通常会自我审查的分布外假设。一个验证者在工具调用网关处运行确定性检查,在危险动作执行前硬性阻止它们。一个代理者从外部知识库中检索遥远但相关的类比,利用刘腾蛟称为对比新颖性检索(CNR)的技术,主动避免标准RAG系统常陷入的同质性陷阱。
结果在自定义的空间语义沙盒中(基于20个随机种子)进行测试,效果显著。完整群体分别以95%和100%的概率发现了两个远程科学目标区域:量子生物合成区和热电单层区。相比之下,同质多智能体辩论配置(AutoGen风格)仅实现了10%的远程目标发现率,且令牌成本高出68%。
疤痕机制:将失败变为可复用资产
该论文最独特的贡献可能在于其对失败的处理方式。与其丢弃违反安全边界的执行轨迹,系统将它们编译为带签名的约束补丁,称为疤痕。编译过程使用蒙特卡洛树搜索在语法受限的抽象语法树上进行,生成紧凑的DSL规则,以在后续运行中阻止违规的工具调用。疤痕使用操作员的Ed25519密钥进行加密签名,以防止在去中心化设置中被恶意注入,并以零训练成本被后代群体继承。
刘腾蛟证明,这种缓存机制并非主要的安全闸门, , 该角色属于实时验证者, , 但它显著改善了令牌经济性。移除疤痕缓存后,每次成功发现的令牌成本增加了15.1%(从72,180个增加到83,060个),因为智能体反复提出已知的越界命令并触发冗余的验证检查。经过100代,冗余的安全冲突从每运行10.2次降至第五代时的几乎为零。
刘腾蛟写道:“疤痕更类似于一个优化效率的约束缓存,而非主要的安全闸门。”这一区别至关重要:系统从不依赖静态规则来确保安全;它在实时守门人之上叠加了一个动态、编译的记忆层。
对比新颖性检索:打破同质性锁定
代理节点使用对比新颖性检索,刘腾蛟将其与传统最大边际相关性进行了对比。最大边际相关性在静态文档列表内实现多样化,而对比新颖性检索是以目标为条件的:它最大化与任务验证目标的相似性,同时惩罚与整个多智能体对话历史的相似性。这种反同质性约束迫使代理者从语义遥远的领域导入知识。
这种效果在目标1的发现率上最为明显。没有代理者时,群体发现量子生物合成区的概率恰好为0%, , 该目标位于智能体的“正常行走范围”之外。使用对比新颖性检索后,发现率跃升至95%。在一项使用10,000篇生物学和材料科学预印本的真实世界检索实验中,对比新颖性检索实现了89.4%的域外召回率,而标准密集RAG仅为24.1%。三位博士评审员将对比新颖性检索检索到的文档的创新新颖性和实用性评为4.5/5,而标准RAG为2.3/5。
安全而不僵化
验证者的设计体现了精细的校准,以避免过度封锁。在针对AgentHarm基准测试中1,000个对抗性情节的测试中,完整群体实现了0%的已执行违规行为,而仅使用提示约束的配置(如ReAct和AutoGen)的违规率为11.5%-19.2%。重要的是,良性任务成功率仍高达88.5%,误阻断率仅为4.8%。在WebArena Lite(一个现实的网络导航基准测试)上,该群体在更少的平均步数(11.5步对14.2-18.5步)下实现了78%的成功率(ReAct为58%,AutoGen为54%)。
该论文还解决了困扰无约束多智能体系统的通信混乱问题。通信分配分数使用温度调节的softmax函数,根据角色特定奖励分配出站令牌带宽,防止低效用智能体触发“对话广播风暴”。消融实验证实了其必要性:移除通信分配分数限流后,两个远程目标发现率均降至25%,令牌成本飙升至每次成功163,520个,是完整群体72,180个的两倍多。
对领域的意义
刘腾蛟的工作处于多个活跃研究方向的交汇点:多智能体协作(AutoGen、CAMEL、MetaGPT)、运行时安全(NeMo Guardrails、ToolEmu)以及多样性感知检索。但这种综合是新颖的。通过将探索与安全的权衡外部化为独立的角色,并将失败视为可编译的约束而非噪声,这种群体架构提供了一条创造性与谨慎性并非零和游戏的路径。
论文坦诚地讨论了其局限性。评估是在一个带有投影语义空间的试点沙盒中进行的,蒙特卡洛树搜索编译器的次线性增长假设虽然得到最多500次失败的经验数据支持,但仍有待更大规模的验证。安全单调性属性仅在撤销前成立,而撤销机制本身(去甲基化)仅被勾勒而未进行严格评估。
尽管如此,这些结果足以引起任何构建自主智能体系统的研究者的关注, , 无论是用于科学发现、代码生成,还是任何失败成本高昂的领域。刘腾蛟的核心见解是:如果你愿意把每项工作交给不同的智能体,你就不必在创造性智能体和安全智能体之间做出选择, , 这可能是AI领域一直缺失的六字总结。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。