FP8 量化
2 published articles
Qwen / 阿里巴巴5 min read
AI 安全
消融版 Qwen3.8-27B:拒绝率降至 0%,基准测试几乎未动
Qwen3.8-27B 的消融版 FP8 量化构建在 AdvBench 上对有害提示的拒绝率从 99% 降至 0%,而通用基准测试的差距保持在 1.3 个百分点以内。模型卡以非同寻常的详细程度记录了该方法。其中的警示同样值得关注。
2026-08-16
人工智能3 min read
人工智能
Aleph Alpha新发布的超级内核库将MoE推理延迟降低200%
Alpha-MoE将多个操作融合到单个持久内核中,在vLLM和SGLang中相比基于Triton的内核实现了高达200%的推理速度提升,目标为FP8精度的MoE模型。
2026-07-09