消融
2 published articles
Qwen / 阿里巴巴5 min read
AI 安全
消融版 Qwen3.8-27B:拒绝率降至 0%,基准测试几乎未动
Qwen3.8-27B 的消融版 FP8 量化构建在 AdvBench 上对有害提示的拒绝率从 99% 降至 0%,而通用基准测试的差距保持在 1.3 个百分点以内。模型卡以非同寻常的详细程度记录了该方法。其中的警示同样值得关注。
2026-08-16
人工智能Featured5 min read
本地AI
无审查模型悖论:拒绝少了,安全也丢了,以及本地AI为何仍然重要
对五个本地运行的无审查大语言模型进行基准测试显示,消融手术将过度拒绝率从44%降至接近零,且不影响推理能力,但同样的编辑将安全拒绝率从41.5%降至9.5%,因为两者依赖于相同的内部方向。运行无审查模型的真正原因可能并非你想象的那样。
2026-07-19