SevenTnewS

AI 智能体

将标准操作规程视为代码:一种新的堆栈分页运行时将强智能体与弱智能体区分开来

来自香港和中国内地的新研究表明,将SOP编译为可执行的伪代码并在堆栈分页虚拟机上运行,能够清晰地分离出能力强的智能体与脆弱的智能体。该工作得出了一个精确的部署规则:先编译,只有在通过模型级别的纪律检查后才能分页。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-04 · 阅读需 5 分钟

将标准操作规程视为代码:一种新的堆栈分页运行时将强智能体与弱智能体区分开来
来源 : Compile, Then P…

银行呼叫中心的智能体必须遵循标准操作规程:验证客户身份、检查账户状态、评估资格,然后处理请求或拒绝。每个企业智能体都面临这个任务。主流方法是将整个SOP作为文本放入提示中,这存在众所周知的失败模式:每轮大约一万字的常驻散文会与对话争夺注意力,而口语化会剥离可执行的结构,例如备选顺序和门短路。

来自香港理工大学、香港大学和浙江师范大学的一篇新论文,题为《先编译,再分页:可执行SOP程序及面向过程LLM智能体的能力门控运行时》,采用了不同的方法。作者将SOP视为程序而非文本。一个离线的确定性编译器将基准测试的机器可读依赖约束转换为两层伪代码程序:针对每个用户目标的过程函数,以及将每个约束与验证配方和携带证据的返回值配对的规则子程序。一个在线的程序引导(PG)运行时将其作为两层虚拟机执行,其中符号栈机处理记账(堆栈、游标、变量、恢复)并仅将活动帧分页到上下文中,而LLM则进行对话、调用工具和判断证据。

三臂设计

该研究在SOPBench上采用三臂设计,SOPBench是一个将SOP合规性视为在领域模拟器上执行工具使用任务的基准测试。三个臂(官方文本、编译文本、编译程序加运行时)在跨越能力等级的六个模型上,将表示与运行时在相同任务上分离。

  • offtext:基准测试的官方口语化约束文本,每轮常驻(SOP即提示的基线)。
  • flat:编译程序的完整文本,每轮常驻(编译表示,无运行时)。
  • pg:由PG运行时使用即时指令分页执行的同一编译程序。

在主要归属领域Bank(125个干净任务)上的结果显示,用编译程序文本替换官方SOP文本使DeepSeek-V4-Flash的通过率从70.4%提升至86.4%(+16.0个百分点;26:6,p < 0.001)。在相同程序上启用PG运行时又增加了6.4个百分点,在干净子集上达到92.8%,拒绝正确性达到100%(86/86)。分解显示,编译和分页主要使强模型获得了正确的拒绝行为:执行变化不大(74.4%到71.8%到76.9%),而拒绝率从68.6%上升到93.0%再到100%。

出现能力门控

在六个模型中,运行时效应并非围绕零的噪声。其范围从强模型的+6.4(DeepSeek-V4-Flash,p = 0.021)和+3.2(n.s.),通过同一供应商在零两侧的探测对,下降到Qwen2.5-7B的-14.4(p = 0.011)和GPT-4o-mini的-26.4(p < 0.001)。将两个强模型合并得到15:3的不一致比(p = 0.016);两个弱模型各自显著为负。相同配置的重复运行使每个模型保持在零的同一侧。

这种模式扩展到所有七个领域。对于强模型V4和Plus,合并的不一致比达到58:19(p约10-5)和75:31(p = 2.3 x 10-5),没有领域显著反转其符号。弱模型在所有领域都受到损害,7B模型合并为59:237(p约10-26)。

解耦编译:内容 vs. 格式

编译既增加了内容(验证配方、验证器门闭合、证据纪律),又将策略重新格式化为代码。一个2x2设计(官方内容或编译内容 x 散文或代码)将两者分离。格式效应符号反转:将官方散文重写为代码使强模型获得+14.4个百分点,但使弱模型损失-12.8个百分点。在固定散文格式下的内容效应,强模型为+17.6,但在弱模型上未检测到(+2.4,n.s.)。一旦内容被编译,格式不再重要(flat vs. c-prose:-1.6和+0.8,均n.s.)。对于从业者:编译表示从未显著损害;孤立的在低能力线以上有收益;代码语法应仅保留给明确受益的模型。

运行时为何被门控:纪律,而非重构

定向状态重构探测在所有四个被探测模型上得分接近上限(0.91到0.99),包括两个运行时失败者。门控并非在要求时无法重构状态。一项未提示的审计,测量目标操作成功后发出的平均领域调用次数,用一个符号规则区分了受损害和未受损害:两个显著受损害的模型正是具有正签名的模型(+0.37, +0.57);所有四个未受损害的模型具有负值(-0.14到-0.49)。重构能力在探测处普遍存在;自发的状态纪律才是运行时门控所追踪的。

注意力层面的测量证实了这一差距。DeepSeek-V4-Flash自发地给予其占上下文2.1%的帧一个相等份额(1.05 对比 flat 的 0.96),而消融整个对话历史使黄金操作的log概率增加1.9 nats。Qwen2.5-7B在自己的轨迹上仅给帧0.15倍于等价的份额,但重新呈现干净时则为0.87。这是在注意力层面的能力部署差距。

部署指南

结果否定了“更多脚手架总是更好”的观点。当官方散文表现不佳时进行编译;仅在模型级别检查后使用代码语法;仅在纪律检查后使用分页。强模型受益于活动帧显著性(拒绝收益的大部分可通过将活动帧放在最前面同时保留完整程序来恢复),而选择性可见性带来较小的以拒绝为中心的收益。对于弱模型,使用强大的执行框架但不使用活动帧指导。分页是软性且可审计的,因此不可逆操作仍需要硬工具层防护。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。