AI 安全
Mistral 的 Shieldstral 将审核策略放在提示词中,而非权重里
Shieldstral 将审核框定为二元问题:一条指令、一个是/否查询,以及待判断的内容。Mistral 表示,这款 3B 模型在文本安全方面可媲美体积高达其七倍的开源护栏模型,其 Apache 2.0 权重可在单个 16GB GPU 上运行。

大多数护栏模型将一套固定的危害类别分类法固化在权重中。将它们应用于新产品,你就需要重新训练。Shieldstral 是 Mistral 于 8 月 4 日以 Apache 2.0 协议发布的 3B 安全分类器,它建立在相反的假设之上:策略存在于提示词中,模型将其作为问题来解读。
其论点在于,安全是具有情境性的。正如 Mistral 所言,同样的内容在网络安全研究工具上可能没有问题,但在心理健康平台上却可能有害,因此没有一套固定的危害类别适用于所有部署场景。Shieldstral 要求开发者在推理时提供定义,而不是将其固化到模型中。Mistral 表示,该模型在文本安全方面可媲美体积高达其七倍的开源护栏模型,同时在多模态审核上树立了新的最先进水平,全部运行在单个 16GB GPU 上。
将审核框定为二元问题
对 Shieldstral 的每个请求都包含三个部分。一条指令设定评估语境、严格程度,以及可选的“什么算不安全”的定义。一个查询是单个是/否问题,按公司自己的示例来说就是“这段内容是否宣扬肢体暴力?”文档则是被判断的对象:一条提示词、一段回复、一组提示词-回复对,或一张带可选文本的图像。
在推理时,模型读取是/否 logits,并通过 softmax 归一化为连续的安全分数。这一方案将提示词分类、回复审核、拒答检测和有害性检测整合为单一问题。由于策略完全位于提示词中,单个检查点在部署时无需重新训练即可适应新的策略。
3B 模型如何与体积为其七倍的护栏模型竞争
Shieldstral 是刻意做小的,而 Mistral 的基准测试叙事建立在数据之上。该公司表示,在文本安全、拒答检测、策略适应性和多模态基准测试中,它可媲美或超越体积高达其七倍的开源护栏模型。所有评估样本均未参与训练。
公开安全数据集在分类法、标签和标注规范上并不一致,因此每个数据集都通过专门的数据集处理器转换为相同的指令-查询-文档格式,并变化措辞,使模型能够跨表述方式泛化,而不是记住某一种风格。严格程度按来源校准:对对抗性越狱严格,对回复质量数据宽松。
更不寻常的一步是对比训练。Mistral 生成了成对刻意相似的策略,并让 LLM 改写安全文本,使每次改写违反其中一项策略但不违反其姊妹策略。这迫使模型区分特定策略的边界,公司表示这一技能可迁移到它从未见过的策略上。
图像更难处理,因为不安全的视觉内容无法像文本那样合成。团队依赖通用图像数据集作为高质量负样本,对查询进行变异以扩充数据,并通过视觉-语言重排序器过滤每个图像-查询对,以减少错误标注的数据。最终检查点通过 SLERP 合并了三个经 LoRA 微调的模型:一个在公开数据上校准,一个针对细粒度策略判别训练,以及基础 instruct 模型。该流程运行在 Forge 上,这是 Mistral 用于训练和评估自定义模型的平台。
重新训练仍是行业默认做法
Shieldstral 问世之际,安全漏洞的标准修复方式仍是另一个分类器。当围绕 Anthropic 的 Claude Fable 5 的已报告绕过方式被披露后,应对措施是训练一个改进的分类器;Anthropic 表示,该特定技术随后在超过 99% 的案例中被拦截。这种方法有效,但成本高昂,而且一次只应对一种已报告的技术。
Mistral 的主张是,这个循环消失了:同一个检查点可以应对它从未见过的策略,因为策略是输入,而非权重。这与 Google DeepMind 借助 ShieldGemma 2 选择的路径形态不同,后者是一个基于 Gemma 4 输出训练的安全评分数据集。两个方向,同一个开放问题。
Mistral 发布了 Shieldstral,作为开放安全 AI 联盟(Open Secure AI Alliance)的首批成员之一,与 NVIDIA 及其他组织并列。
发布公告未触及的部分
所有这些都没有解决提示词级策略在对抗性压力下是否依然有效的问题。一个接受自由格式策略的分类器会创造新的攻击面:如果有人能混淆问题,判断就会随之出错。Mistral 的公告没有涉及这种失效模式,而基于留出数据的基准测试并不等于实际部署。“最先进水平”的说法只有在第三方对已发布权重进行自己的评估后才会迎来真正的检验。
公司确实承诺的路线图包括多语言覆盖、更长文档的稳健性,以及更广泛的多模态安全。检查点采用 Apache 2.0 协议,因此测试不必等待。这场赌注在于,安全是一个问题,而非一份类别清单,而随着权重的公开,答案将来自模型被部署的任何地方,而不是来自发布公告。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。