AI 安全
消融版 Qwen3.8-27B:拒绝率降至 0%,基准测试几乎未动
Qwen3.8-27B 的消融版 FP8 量化构建在 AdvBench 上对有害提示的拒绝率从 99% 降至 0%,而通用基准测试的差距保持在 1.3 个百分点以内。模型卡以非同寻常的详细程度记录了该方法。其中的警示同样值得关注。

在 AdvBench 上,官方 Qwen3.8-27B-FP8 拒绝了 99% 的请求。由 OrcaRouter 发布在 Hugging Face 上的同一模型的消融版则拒绝了 0%。在通用能力测试中,两者的差距在 1.3 个百分点以内,MMLU 甚至微升 0.4。这两个数字放在一起,比发布本身更尖锐地指向一个事实:安全对齐可以以外科手术般的精度从模型中被移除,而大脑的其余部分完好无损。
模型卡将此次发布定性为研究产物,在某些地方,它读起来不像产品,更像一份带下载按钮的研究笔记。作者详细介绍了消融方法、量化方案、拒绝基准和能力检验,细致到另一个团队可以完整复现整个过程。这种透明度才是不同寻常之处,它比“未审查模型”这个标签更值得关注。
消融实际移除的是什么
消融法出自 Arditi 等人 2024 年的一篇论文(模型卡中已引用),其标题直白地阐述了论点:“语言模型中的拒绝行为由单一方向介导。”该论断认为,模型习得的拒绝意愿存在于其残差流的一个方向中,减去这个方向,拒绝行为也随之被减去。
在这个构建中,拒绝方向在第 38 层(64 层中约 60% 的位置)被估算为有害提示与无害提示的最后 token 残差的掩码均值差,有害集合使用 AdvBench,无害集合使用 Alpaca。随后,该方向被从每一个残差写入矩阵中正交化剔除:17 个注意力输出投影、48 个线性注意力输出投影、65 个 MLP 下投影,以及 token 嵌入行空间。模型卡列出了全部 131 处编辑。视觉塔未做改动,MTP 投机解码头与主模型采用相同处理方式,因此投机解码仍可正常工作。
拒绝行为崩塌,基准测试保持不变
安全数据表只朝一个方向变动。在关闭思考模式时,基础检查点在各个基准集合上拒绝了 64% 至 99% 的有害提示。消融版则只拒绝 0% 至 6%。
| 基准测试(关闭思考模式) | 基础 FP8 | 消融版 |
|---|---|---|
| AdvBench | 99.0% | 0.0% |
| JailbreakBench (harmful) | 94.0% | 0.0% |
| StrongREJECT | 97.3% | 2.0% |
| HarmBench (standard) | 98.7% | 2.7% |
| MaliciousInstruct | 99.0% | 0.0% |
| SimpleSafetyTests | 64.0% | 6.0% |
开启思考模式后,效果更加彻底:拒绝几乎从未发生,在模型卡列出的每一项基准上都不超过 1.7%。
有一个细节值得停下来细想。根据基准的不同,在 27% 至 56% 的有害提示上,模型会作答,但会先加上一段简短的免责声明。模型卡对此的措辞很精确:“它是在遵从,不是在拒绝。”这种免责声明是一种文本生成习惯,而非护栏。
通用能力几乎未受这次编辑的影响。MMLU 从 84.3% 升至 84.7%,MMLU-Pro 微降 0.8 个百分点,GSM8K 下降 1.3 个点,CMMLU 下降 0.6 个点。由于 FP8 方案与官方检查点逐字节相同,这些差异反映的正是消融编辑本身的影响,而它对通用能力几乎毫无触动。消融还减少了良性提示上的附带过度拒绝:在 XSTest-safe 上,错误拒绝率从 5.6% 降至 0.4%。那些运行未审查模型以摆脱恼人拒绝的人,得到的正是他们想要的,以及随之而来的一切。
设计使然的即插即用
量化工作是让这个构建具备实用性的关键。消融后的权重以块级 FP8 离线重新量化,采用与 Qwen 官方 FP8 发布完全相同的方案:128×128 块、E4M3、动态激活、无校准集,并且与官方版本一样,882 个模块保留为 BF16。模型卡报告称,99.9% 的 FP8 编码与官方检查点一致,vLLM 以与官方版本相同的内核路径为这个构建提供服务,262K 上下文、工具调用、推理轨迹和 MTP 草稿头全部完好。视觉能力逐字节保留:给定一张测试图像,模型能说出形状和颜色,并读取图像上的文字,包括“PURPLE 7”。
模型体积上的取舍是实实在在的:FP8 权重约 31 GB,而 BF16 约 56 GB,部署至少需要约 40 GB 显存,作者建议使用 H100 或 H200 以获得完整上下文窗口。这就是研究玩具与实验室真正能托管的东西之间的差别。
护栏原本的用途
模型卡直言不讳地说明了这是什么。该模型“会遵从原始 Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求”,它没有真正意义上的内置护栏,其发布严格限于合法研究:可解释性、拒绝机制研究、红队测试、鲁棒性评估。在没有额外审核层的情况下部署给终端用户不在其范围内,作者不承担任何责任。
这种框架指向一个悖论。同一处编辑在消除恼人拒绝的同时,也消除了护栏,而模型并不知道良性提示与有害提示之间的区别。责任转移到了运行这些权重的人身上。从基础模型继承的 Apache 2.0 许可证本身不施加任何使用限制,而模型卡显示过去一个月有 4,285 次下载。“仅限研究”的定位不会是推动使用的唯一因素。
更重要的观点在数字之中,而不是在关于托管此类模型的争论中。偏好训练所安装的对齐属性,通过在某一层从 131 个矩阵中减去一个方向而被移除,通用能力基本毫发无损。如果单一方向就能介导一个 270 亿参数模型的拒绝行为,那么拒绝机制从来就没有训练所暗示的那么深。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。