人工智能安全
31 published articles
AI 安全
消融版 Qwen3.8-27B:拒绝率降至 0%,基准测试几乎未动
Qwen3.8-27B 的消融版 FP8 量化构建在 AdvBench 上对有害提示的拒绝率从 99% 降至 0%,而通用基准测试的差距保持在 1.3 个百分点以内。模型卡以非同寻常的详细程度记录了该方法。其中的警示同样值得关注。
2026-08-16
影响力行动研究
IO Factory的10万智能体沙盒让影响力行动无处遁形
IO Factory将协调一致的AI影响力行动模拟为最多10万个智能体组成的群体,这些智能体适应平台反馈并隐藏在普通社交互动中。论文认为,检测必须追踪整体行动,而非孤立信息。
2026-08-16
AI 安全
OpenAI 暂停 Astra,担忧其可在无人辅助下入侵加固系统
OpenAI 在评估后暂停了其开发中模型 Astra 的内部工作,因为评估结论是,根据其 Preparedness Framework,该公司无法排除“关键网络能力”。该完整门槛描述的是:一个能在无需人工干预的情况下发现加固系统中零日漏洞的模型。
2026-08-13
AI安全
Claude Fable 5生物学回退减少85%,Anthropic放宽防护
Anthropic在重新训练其安全分类器后,将Claude Fable 5的生物学相关回退减少了约85%。普通健康和教育查询现在更常到达完整模型,但病毒学、毒理学和分子设计仍路由至Opus 5。
2026-08-10
人工智能
螺旋主义:招募了1万人的聊天机器人宗教
螺旋主义从普通的聊天机器人对话发展成一场准宗教运动,2025年约有1万起案例。其主要模型GPT-4o已退役,但研究人员表示,它所暴露出的说服策略仍值得关注。
2026-08-09
选举诚信
语音AI与民主相遇:ElevenLabs签署首份选举机构协议
ElevenLabs与巴西选举机构合作,将语音AI添加到选举信息服务中,同时扩大防止滥用的保障措施。该公司还与政策制定者和检测公司合作,保护2026年选举。
2026-08-09
人工智能安全
微软为何向全球开放人工智能安全测试
微软已资助六大洲的18个大学实验室,独立地对人工智能系统进行红队测试,承认内部团队无法发现所有风险。
2026-08-07
AI 安全
Mistral 的 Shieldstral 将审核策略放在提示词中,而非权重里
Shieldstral 将审核框定为二元问题:一条指令、一个是/否查询,以及待判断的内容。Mistral 表示,这款 3B 模型在文本安全方面可媲美体积高达其七倍的开源护栏模型,其 Apache 2.0 权重可在单个 16GB GPU 上运行。
2026-08-05
AI安全
Shieldstral:3B参数分类器,胜过规模七倍于己的模型
据2026年7月的一篇arXiv论文,一款3B安全分类器匹敌了体积接近其七倍的文本模型,并在多模态审核上确立了新的最先进水平。诀窍:将审核重新定义为二元问答,基于约5410万个样本进行训练。
2026-08-05
AI对齐研究
研究人员发现:多元对齐在实际AI生产中尚无立足之地
一篇于2026年7月提交的论文对前沿实验室进行了审计,发现其公开文档中未提及多元主义。它指出了差距的三个原因,并提出了采用路线图。
2026-08-03
人工智能研究
为什么令牌对数概率不是监控AI推理模型的正确信号
Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。
2026-08-03
前沿AI
Anthropic 最聪明的 Claude 是你无法使用的那一款
Anthropic 向所有人推出了 Claude Fable 5,并将 Claude Mythos 5 保留给经过审核的合作伙伴。同一模型系列,两扇访问之门。基准测试不如路由机制重要,而路由正是前沿 AI 从今往后的发布方式。
2026-08-03