AI 研究:工业级内容风控
SIRF 的 15.1 个百分点增益来自权重,而非提示词
SIRF 通过基于合成政策数据的持续预训练,将平台的审核规则从提示词中移出、植入模型权重。这篇论文真正的卖点在于其控制变量:只改变一个变量,换来 15.1 个百分点的提升。

15.1 个百分点的说法,以及支撑它的对照设计
SIRF 摘要中的头条数字, , 71.3% 的 Black Recall@P95, , 单看几乎说明不了什么。摘要没有点名任何生产平台,也从未定义“Black”或 P95 阈值究竟指什么。只有看到其底层支撑,这个数字才有分量:一个被设计成只改变一件事的对照实验。
作者在同一来源上运行 Qwen3-8B-SFT 与 SIRF-8B-SFT,政策注入方式完全相同,输出格式也同为仅给判定结论。唯一的差异是 SIRF 的、以政策为基础的持续预训练。SIRF-8B-SFT 达到 71.3% 的 Black Recall@P95,比算术推算为 56.2% 的基线高出 15.1 个百分点。这一对照设计才是其贡献所在。更强的基座模型或更好的提示词都会让两组结果相互混淆。
| 实验组 | Black Recall@P95 | 以政策为基础的 CPT |
|---|---|---|
| Qwen3-8B-SFT(基线) | 56.2%(由所述差距推算) | 否 |
| SIRF-8B-SFT | 71.3% | 约 7000 万 token |
其后还有一个更弱的次级对比:在该接口下暴露 logprobs 的入选模型中,SIRF 与规模远大于自身的系统持平或超越。
“规范内化”是什么意思:基于合成政策的持续预训练
SIRF 是 Spec-Internalized Risk Foundation Model(规范内化风险基础模型)的缩写,这个名字描述的是一条训练流水线,而非一种架构。作者将平台现有的政策文档扩展为训练数据,没有再委托新的人工标注。三项具名步骤承担了这项工作:EntiGraph、MAGA 改写,以及账号级思维链。随后该语料通过持续预训练重新进入模型,于是规则最终进入权重,而非在每次请求时重新陈述。
与之形成对照的是大多数团队所用的护栏技术栈。提示时注入与基于规则索引的检索,都把政策留在模型之外。当规则每小时都在变时,这很方便;当规则不变时,则代价高昂:每一次请求都要为重新陈述规则付出代价,而每一次重新陈述都可能引入漂移。持续预训练只需一次性支付这笔成本;按基础模型的标准,论文为这一转变所设的预算很小,约为 7000 万 CPT token。
是精确率与秒级延迟,而非平均准确率
摘要开篇就否定了大多数模型论文所主打的指标:作者写道,平均准确率并非硬约束。真正重要的是,在高精确率、秒级延迟的条件下,系统无需人工介入能处理多少风险。
应把这理解为一项运营主张,而非机器学习主张。一个平均得分很高、但返回太慢而错过实时窗口,或不够精确以致审核人员必须复核其大部分判定结果的模型,既不能削减人力,也不能降低风险敞口。部署形态由这一约束推导而来:SIRF 只返回一个判定结论,别无其他。没有理由说明,没有推理时思维链,没有任何需要审核人员在行动前阅读的内容。
SIRF 运行在一个树模型裁决层之内,作者称该层可多挽回 20% 被误判处罚的样本。这是摘要中最具体的生产落地主张,也是外界最难核验的一项。
迁移、成本,以及 7000 万 token 能买到什么
两项次要结果的分量,比它们所处的行文位置所暗示的更重。SIRF 能以低成本迁移到一个冻结场景,误判处罚相对减少约 70%。而且作者称,CPT 训练没有损害通用能力, , 当模型在某一狭窄领域被高强度调优时,这通常是常见的牺牲品。
第二项主张才是值得追问的地方。“未损害通用能力”需要一整套带有前后得分的基准测试,而摘要一项都没给。迁移结果则更单薄:冻结场景只出现在一个从句中,既没有评测规模的细节,也没有说明是否复用了同一套政策语料。
| 报告的结果 | 数字 | 摘要中缺失的内容 |
|---|---|---|
| 树模型裁决层 | 多挽回 20% 被误判处罚的样本 | 评测集规模 |
| 向冻结场景的迁移 | 误判处罚相对下降约 70% | 场景定义 |
| 通用能力 | 据作者称未变化 | 基准测试清单、前后得分 |
token 数量真正支撑的是一个成本论点。与应用其基座模型背后的预算相比,7000 万 token 的持续预训练只是一次规模不大的训练。值得验证的主张,不是 SIRF 构建一次很便宜,而是内化的成本低到可以按平台重复。这才是“规范内化”在商业上必须意味着的东西:一条把每个平台的私有政策转化为其自身检查点的流水线,而不是一个能跨多套规则手册泛化的模型。
摘要留下的未解之处
对于任何评估这一结果的人,有四处空白格外突出。
- 同行评审:该条目给出的提交日期为 2026 年 9 月 10 日,归类于 cs.AI,没有给出发表会议或期刊。那么,这些是预印本数字。
- 来源:政策数据来自一家平台的规则集,被描述为复杂但未具名。没有报告第二次部署。
- 对比的外沿:“在入选的、该接口下可获取 logprob 的模型中”是一个狭窄的范围。不暴露 logprobs 的模型不在该主张涵盖之内。
- 延迟:整套论述的关键在于秒级与超低延迟推理,然而摘要没有给出模型或裁决层的任何毫秒级数字。
受控对比是这篇论文最强的资产,也是它的天花板。第二套规则手册与第三个基座模型,才能真正检验内化是否成立。
- 来源 : SIRF's 15.1-point gain lives in the weights, not the prompt — 2026-09-10
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。