量化
4 published articles
Meta AIFeatured4 min read
开源AI
Muse Glimmer:Meta的300亿参数智能体占用不到20GB,无需云端
Meta 开源了 Muse Glimmer,这是一个 30B 智能体模型,可在单块消费级 GPU 上离线运行。量化使其保持在 20 GB 以下,DFlash 草稿模型在 RTX 5090 上带来最高 3.1 倍的解码加速,权重以 Apache 2.0 许可发布在 Hugging Face 上。
2026-08-10
Qwen / 阿里巴巴4 min read
Qwen / 阿里云
Qwen2.5-Omni 在 OmniBench 上超越 Gemini-1.5-Pro,可在 12GB 以下显存运行
阿里开源模型 Qwen2.5-Omni 在 OmniBench 上得分超过 Gemini-1.5-Pro,并登顶 MMAU 音频推理排行榜。量化版本将显存占用降至 12GB 以下,MNN 支持将实时语音对话带到手机上。
2026-08-07
大语言模型与模型3 min read
人工智能研究
为什么令牌对数概率不是监控AI推理模型的正确信号
Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。
2026-08-03
开源3 min read
模型量化
Unsloth 将 9750 亿参数 Inkling 模型压缩至 270 GB,准确率保留 74%
Unsloth 的动态 GGUF 量化将 9750 亿参数的开放模型 Inkling 从 1.9 TB 压缩至 1 位下的 270 GB,准确率保留 74.2%。该方法有选择性地保留高精度层,从而实现在配备 290 GB 以上 RAM+VRAM 的机器上进行本地推理。
2026-07-16