开源AI
Muse Glimmer:Meta的300亿参数智能体占用不到20GB,无需云端
Meta 开源了 Muse Glimmer,这是一个 30B 智能体模型,可在单块消费级 GPU 上离线运行。量化使其保持在 20 GB 以下,DFlash 草稿模型在 RTX 5090 上带来最高 3.1 倍的解码加速,权重以 Apache 2.0 许可发布在 Hugging Face 上。

你自己的一台机器能装下多少有用的AI?Meta的答案是Muse Glimmer,一款以Apache 2.0协议发布的300亿参数智能体模型。约4位量化将权重压缩到不足20 GB,在24 GB或32 GB的消费级GPU内为模型、工作内存、感知编码器以及一个加速解码的小型草稿模型留出了空间。Meta Superintelligence Labs将其定位为常驻本地智能体、函数调用、本地编程和LLM-as-a-judge评估,无论是否联网均可使用。
速度一直是本地模型的软肋。一个300亿参数的模型逐token生成,会让长推理链和多步工具调用变成一场等待游戏,因此Meta为Glimmer配上了DFlash, , 一个小型伴生网络,它为主模型提议整块token,由主模型并行验证。Meta测得在RTX 5090上解码速度提升3.1倍,在M5 Max上提升1.8倍,在M4 Max上提升1.5倍,输出质量保持不变。
24 GB空间里能装下什么
在全精度下,仅语言模型本身就需要超过55 GB,远超任何消费级GPU。量化后的权重不足20 GB,Meta表示剩余空间可同时容纳模型的工作内存、用于图像的感知编码器和草稿模型。该公司称,这种压缩在智能体任务上造成的性能损失极小,甚至没有损失。以下是Meta公布的尺寸与速度数据。
| 配置 | Meta公布的数据 |
|---|---|
| 全精度 | 超过55 GB,远超消费级GPU |
| K-Quant-Dynamic和K-Quant-17GB | 语言模型不足20 GB;KV缓存、感知编码器和草稿模型可装入24 GB或32 GB空间 |
| 搭配DFlash草稿模型的解码加速,RTX 5090 | 3.1倍 |
| 解码加速,M5 Max | 1.8倍 |
| 解码加速,M4 Max | 1.5倍 |
为会失败并重试的智能体而生
智能体训练体现在具体能力上:结构化工具调用、长程多步推理,以及失败恢复, , 模型会诊断失败的调用并重试,而不是就此停止。专门的感知编码器可接受交错的文本和图像,因此智能体可以在对话中途处理截图、图表或文档。不同的推理强度让开发者可以在质量与速度之间取舍,训练数据覆盖100多种语言。
在DeepSearch QA、MCP-Atlas、tau-Bench和SWE-Bench等端到端智能体基准上, , 这些基准衡量的是在脚手架内从头到尾完成一项任务的能力, , Meta表示,Muse Glimmer在其尺寸级别上取得了很高的成功率。它兼容包括OpenClaw在内的开放编排框架。
Muse系列走向本地
Glimmer并非从零开始。Meta表示,他们利用logit蒸馏从Muse Spark的输出中蒸馏出该模型,保留了与教师模型相似的数据配比,随后在更长、智能体密集的数据上进行中期训练,并通过监督微调、在策略蒸馏和强化学习进行后训练。权重发布前,该版本经过了Meta的Advanced AI Scaling Framework评估。
这让Glimmer与Meta正在快速构建的系列连在了一起。Muse Spark 1.2是Muse Code背后的模型, , Meta为macOS和Linux发布的终端编程智能体测试版,它带有可精确重放的事件日志和无需人在键盘前就能持续工作的后台子智能体。Glimmer继承了这种推理能力,并将其缩小到适合一台可能离线使用的笔记本电脑的尺寸。llama.cpp、MLX和ExecuTorch支持将在未来几天内落地;Ollama、LM Studio和Unsloth也将跟进,让本地安装变得简单。vLLM和SGLang覆盖大规模服务,托管选项来自Together AI、Fireworks AI和OpenRouter,开发者还可以通过PyTorch的TorchTitan进一步定制权重。Meta列出的硬件合作伙伴包括AMD、Arm、Dell、Intel和NVIDIA。权重现已上架Hugging Face。
开放权重,自有硬件
战略赌注在于许可证。Apache 2.0意味着任何人都可以fork Muse Glimmer、重新训练它或将其嵌入产品中,而无需向Meta付费, , 这是这家公司多年来在研究中一直使用的打法,如今指向了智能体。对这个押注数十亿美元、相信开放权重终将获胜的实验室来说,这是惯用的一招。Meta将该模型与Gemma4-31B和Qwen3.6-27B进行对比,称其在多个广泛使用的基准上于同尺寸级别中表现强劲;不过发布帖并未给出自己的分数,而是指向另一份报告了解细节。
追逐设备端智能体的不止Meta一家。Liquid AI在8月也做了类似的推介,推出LFM2.5-2.6B, , 一条26亿参数的模型线,几乎可以在任何地方运行,包括浏览器内。Glimmer瞄准的是比Liquid的小型模型更重一档的智能体工作负载,运行在人们已经拥有的同类硬件上,并在Meta的AI开发者中心(dev.meta.ai)提供了文档和设置指南。开放权重的推进也触及了尺寸谱系的另一端,阿里巴巴即将发布Qwen3.8-Max。
悬而未决的问题在于验证。Meta的基准来自Meta自己,在家用GPU上的独立运行将决定实际体验与图表数据有多接近。无论结果如何,方向都是明确的:智能体适配人们已经拥有的硬件,权重任何人都可以fork,推理被视为一个位置问题,而不是默认上云。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。