arXiv上的AI对齐研究,2026年9月10日
赋予AI一个"人造本我",或许能修复控制,也可能固化失败
该预印本主张,对齐应当是持续运行的智能体系统的一种属性,而不是单次模型回复的属性;针对单次回复的检查无法移除一个会延续到下一个任务的坏策略。其证据是一个小到无法进行推理的控制器。

Yakov Shkolnikov在9月10日一篇预印本中所描述的实验中,那个控制器小到无法进行推理。它没有被赋予任何任务特定的行为目标。但它仍然发展出了有用的控制能力,因为比其他行为更能持续存在的行为会被选中,而控制器正是那个持续存在的东西。
这篇论文《人造本我:智能体AI中的驱动力与持续性对齐》(Artificial Id: Drive and Persistent Alignment in Agentic AI)提出了一种内在驱动力,用来决定行为应当继续、停止还是改变。其论述框架比实验本身更具野心,而实验只是一个虚拟培养皿。
一种无人指定的驱动力
摘要从一个已在发生的转变出发:智能体系统正从有界的任务执行,转向能够保留具有后果的状态、持续运行并跨越任务边界进行适应的系统。这就产生了一个控制问题,而当前的各类框架大体上靠人工来解决它。目标、重试、验证、停止规则以及其他行为转换,都在智能体之外被指定,并从外部强制执行。另一侧的失效模式已有记录:当记忆不再为真之后仍然可被检索,比完全没有记忆更糟,正如TEPA关于智能体陈旧记忆的研究所发现的。
人造本我会把其中一部分移入内部。论文将其定义为一种自适应内在驱动力,用来决定行为应当继续、停止还是改变。有意思的论点并不是智能体会行动, , 这是设定所假定的前提, , 而是有用的方向可以在从未被写成行为目标的情况下自行涌现。
这个名字带有弗洛伊德式的回响:一种在推理之前就已有所欲求的内在力量。而这里描述的机制要朴素得多, , 是差异化的持续性,而非欲求。
培养皿究竟展示了什么
证据被刻意限定在很小的范围内。实验是极简的、虚拟的,其控制器被描述为小到无法进行通用推理。这一限制在论证中起到了实质作用。如果控制行为是在一个不可能靠推理得出答案的组件中涌现出来的,那么产生它的就是推理之外的某种东西。
论文报告了两项结果。当某种行为持续得更好时,控制器会选择一种并非预期的物理策略。随后,当某个已习得的传感器映射在环境中的含义发生变化时,它会替换掉该映射。两者都是作为结果而非演示呈现的。
| 摘要所陈述的内容 | 它所省略的内容 |
|---|---|
| 一个小到无法进行通用推理的控制器,未被赋予任务特定目标 | 其规模、架构或训练方法 |
| 一项极简的虚拟培养皿实验 | 运行次数、基线、成功指标 |
| 一种并非预期、因持续得更好而被选中的物理策略 | 该策略究竟是什么,以及"更好"是如何衡量的 |
| 当一个已习得的传感器映射含义改变时将其替换 | 是哪些传感器,以及替换是否成立 |
| 一道横跨观测、状态、权限、身份、来源与约束的边界 | 该边界的任何实现或测试 |
这些空白标记出了这份文档所能支撑的边界。该机制展示的规模小到可以用一句话说完,而论文用一个条件句标记出它自身的推演:一个可扩展的人造本我将把具有后果的状态和自适应驱动力带过那些边界。
同一机制也会把错误保留下来
持续性是这篇论文的枢纽,也是它的警告。让控制器无需被告知就能找到可行策略的那种属性,也正是让坏策略持续运行的那种属性。摘要把这一点说得很直白:失准、被污染的状态和非预期行为之所以能跨越任务边界持续存在,与自适应行为持续存在的原因相同。智能体技能从另一个方向展示了同样的不对称性:层层叠加的修补可能让智能体比开始时更糟,这正是这项关于程序性技能的研究所记录的"回归税"。
与当前做法的对比体现在论文自己的措辞中。对齐将成为持续运行的智能体系统的一种属性,而不是某次模型回复或单条轨迹的属性, , 这暗示着,针对单次回复的检查正是现状所在。一个在任务结束时就会消失的有害输出,只是个糟糕的答案。而一个会延续到下一个任务的有害策略,则是一种长期存在的状态,再多的逐次回复过滤也无法将其移除。单次调用与整个任务之间的这种错配并非对齐所独有:路由系统也撞上了它,这正是TRACE-Router在任务成功层面发挥作用的原因。
对齐是系统的属性,而非回复的属性
什么会取代针对单次回复的检查?摘要列出了持续性对齐边界必须覆盖的范围:可信观测、后果通道、持久状态、权限、身份、来源和硬约束。这是对需要保护之物的界定,而不是保护它的设计。摘要中没有给出该边界的任何实现、威胁模型或评估方法。这份清单中"来源"那一半在其他地方已有可用的先例,即AgentToolMO所提出的信任状态机,用于多供应商智能体网络中被攻陷的工具仍不断被调用的情况。
它也未曾提及任何先前的系统或竞争性方法。任何希望将这项工作与现有关于智能体持久状态的研究进行对照的人,都得自己去做这项梳理。
什么会证伪它
这一主张是可检验的,这比大多数框架性文档所能说的要多。三个问题就能解决其中很大一部分。当持续性不再带来好处时,驱动力是否仍然存续,还是会连同有用的适应能力一起被带走?能否在移除某个非预期策略的同时,让它所源自的自适应行为保持完好?一道针对状态与身份的边界,是真的能捕获被污染的状态,还是只是标出了它会被捕获的位置?
这些问题没有一个能在单篇摘要中得到回答,而这一篇尚未经过同行评审。这不是无视它的理由。这是把持续性主张视为承重结构、而把可扩展系统的措辞视为仍欠证据之部分的理由。其贡献可能比标题所暗示的更窄:一个证明方向可以来自持续存在的演示,以及一个警告, , 持续存在并不会检查它所携带的东西。
- 来源 : Giving AI an "artificial id" could fix control, or entrench failure — 2026-09-10
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。