Shieldstral
2 published articles
Mistral AIFeatured4 min read
AI 安全
Mistral 的 Shieldstral 将审核策略放在提示词中,而非权重里
Shieldstral 将审核框定为二元问题:一条指令、一个是/否查询,以及待判断的内容。Mistral 表示,这款 3B 模型在文本安全方面可媲美体积高达其七倍的开源护栏模型,其 Apache 2.0 权重可在单个 16GB GPU 上运行。
2026-08-05
大语言模型与模型Featured4 min read
AI安全
Shieldstral:3B参数分类器,胜过规模七倍于己的模型
据2026年7月的一篇arXiv论文,一款3B安全分类器匹敌了体积接近其七倍的文本模型,并在多模态审核上确立了新的最先进水平。诀窍:将审核重新定义为二元问答,基于约5410万个样本进行训练。
2026-08-05