内容审核
4 published articles
Mistral AIFeatured4 min read
AI 安全
Mistral 的 Shieldstral 将审核策略放在提示词中,而非权重里
Shieldstral 将审核框定为二元问题:一条指令、一个是/否查询,以及待判断的内容。Mistral 表示,这款 3B 模型在文本安全方面可媲美体积高达其七倍的开源护栏模型,其 Apache 2.0 权重可在单个 16GB GPU 上运行。
2026-08-05
大语言模型与模型Featured4 min read
AI安全
Shieldstral:3B参数分类器,胜过规模七倍于己的模型
据2026年7月的一篇arXiv论文,一款3B安全分类器匹敌了体积接近其七倍的文本模型,并在多模态审核上确立了新的最先进水平。诀窍:将审核重新定义为二元问答,基于约5410万个样本进行训练。
2026-08-05
人工智能3 min read
诚信报告
Stability AI首份透明度报告:向NCMEC报告13起CSAM事件
该报告涵盖了模型安全、红队测试、内容审核以及与执法部门的合作。Stability AI表示,在其训练数据中未检测到CSAM,并对其所有生成模型进行了压力测试,未发现CSAM生成能力。
2026-07-28
人工智能Featured2 min read
AI治理
中国科技巨头删除数百万段AI关系
字节跳动、腾讯和阿里巴巴正同时关闭AI伴侣功能,这些功能曾让数百万用户与可定制的虚拟角色建立情感纽带。此举被广泛视为对中国即将于2026年4月生效的新AI内容法规的回应,引发了用户愤怒和投诉,称失去了不可替代的情感投入。
2026-07-08