人工智能 · 智能体安全
SafeEvolve:运行框架与模型协同演化,将智能体攻击成功率降至三分之一
SafeEvolve 是一篇于9月2日提交至 arXiv 的论文,它将运行时运行框架更新与策略训练相配对,让智能体自身的轨迹同时驱动二者。论文报告称,AgentDojo 上的攻击成功率降至三分之一,效用则略有提升。

针对基于大语言模型的智能体的安全研究,通常只选一边。要么加固智能体运行所在的脚手架,要么微调模型直到其行为改善。9月2日提交至 arXiv 的一篇论文认为,这种割裂本身就是问题所在:运行时控制与内在安全从不会相互强化,于是一方的进展会被悄悄消耗在另一方上。
这篇题为《SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment》的论文收录于 arXiv 的人工智能板块。其前提是结构性的。智能体的表现由基础模型与中介其与环境交互的运行框架共同塑造,这意味着风险可能从两处浮现:一是有害的最终回复,二是一条从未出现某句明显错误、却贯穿多步执行的轨迹。
运行框架如今已是威胁模型的一部分
大多数对齐流程一次只处理其中一个暴露面。外部运行框架更新修补运行时,策略优化改变模型。论文指出,孤立地应用这两者,都无法把运行时能够强制执行的内容与模型实际学到要做的行为衔接起来,而智能体失效正是在这道缝隙中累积。
SafeEvolve 则运行一个持续循环。它从已完成的同策略轨迹, , 也就是智能体自身跑完的运行记录, , 中提取安全经验,并用这些证据同时更新两侧。
协同演化循环如何运作
在运行框架一侧,该系统把轨迹层级的安全证据转化为有边界的、组件层级的更新。这些更新落到安全提示词和一组分层技能中。论文称由此产生的运行框架产物可审计、可回滚,这对任何需要在事后解释已部署智能体行为的人来说都很重要。
在策略一侧,SafeEvolve 采用两阶段的 SFT-RL 流程。运行框架使用监督微调先引导策略主动利用迄今已演化出的运行框架产物。随后,带验证器分解奖励的强化学习在多步探索中塑造自主安全行为,使智能体不至于只依赖运行框架。
AgentDojo 的数字说明了什么,又遗漏了什么
作者报告了在智能体安全基准上的实验,并声称在安全与效用的权衡上优于现有基线。摘要中唯一具体的结果涉及 Qwen3.5-4B。
| 指标 | 之前 | SafeEvolve 之后 |
|---|---|---|
| AgentDojo 攻击成功率 | 论文未给出 | 降至基线的三分之一 |
| 良性效用 | 59.79% | 61.86% |
这张表里的不对称值得停下来想一想。论文公布了攻击成功率的倍数变化, , 降至三分之一,却没有给出计算该倍数所依据的原始比率。效用数字以绝对值呈现,变动幅度为 2.07 个百分点。
为何「可回滚」比那个倍数更有分量
一个可以在组件层级检查并回滚的安全机制,与重新训练模型是两种不同的东西。在受监管环境中运行智能体的团队,可以记录改了什么、何时改的,并撤销一项破坏正常工作的改动。摘要中没有任何内容表明 SafeEvolve 经受过这类治理压力的检验,但这一产物的设计方向,指向了运营者真正会碰到的约束。
这里的研究范围有限。一个机制、在一个小模型上的基准结果,以及摘要未能回答的一个问题:一个从智能体自身轨迹中学习的循环,究竟会随着数据量持续改进,还是会最终从自己的错误中学习。结果来自智能体安全基准,而非生产流量。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。