Meta AI
Muse Code:Meta 在编码智能体竞赛中的抗崩溃押注
Meta 的 Muse Code 为 macOS 和 Linux 带来了一款可抵御崩溃的终端编程代理,由 Muse Spark 1.2 驱动,该模型与其自身的工具框架联合训练,面向长周期任务。Meta 表示,更大、更强的模型已在路上。

Meta 花了十年时间构建社交应用,并在 AI 研究领域积累了声誉。这份声誉来自砸下数十亿美元将研究成果免费开放。如今,它正在推出一款终端编码智能体。Muse Code 目前面向 macOS 和 Linux 提供测试版,可通过一条命令安装:curl -fsSL https://dev.meta.ai/install.sh | bash,并搭配一款新模型 Muse Spark 1.2, , Meta 将该模型与智能体自身的工具框架进行了联合训练。
该智能体可处理大型代码库中的工程任务:规划改动、编写代码、验证结果。对于每项任务,它可以协调多个持久运行的子智能体,这些子智能体会在整个会话期间保持存活,而不是按任务临时生成。Meta 表示,这减少了冗余的信息收集,也降低了开发者在复杂多步任务中需要提供的干预量。
一个能在自身故障中存活的运行时
事件日志是关键的设计细节。Muse Code 会将每一次模型调用、工具运行、审批和编辑追加到本地日志中,该日志成为会话的唯一事实来源。该运行时做到精确重放、重启安全:如果智能体崩溃,它会精确地从停止之处恢复,而不是重新开始。正是这一点让它能够承担长时间运行的任务,而不会被故障打乱。
Meta 随智能体提供了三个默认命令。/plan 将任务转化为需审批的计划,/grill 对该计划进行压力测试,直到它经得起考验,/goal 则朝着完成既定目标推进。将工作组织为显式流程,与将标准操作程序视为代码的研究背后的理念相同, , 该研究发现,仅将流程编译为可执行形式,就能让强智能体的表现提升 16 个百分点。该公司的演示展示了工具的另一个侧面:它接受一段房屋的 mp4 飞越视频作为输入,并据此生成一个度假屋营销与预订页面。
Muse Spark 1.2:与自身工具框架共同训练
Muse Spark 1.2 是 Muse Spark 1.1 的编程重点更新版本,在代码生成、复杂调试、代码库理解以及端到端开发者工作流方面均有改进。Meta 增加了编码任务的训练算力,并扩大了训练环境的多样性,同时保持了模型在通用智能体等其他领域的优势。
不同寻常之处在于它的训练方式。Meta 使用拒绝采样的工具框架轨迹,以及针对目标、压缩和子智能体的配方优化,并整合 Muse Code 工具集,将 Muse Spark 1.2 与 Muse Code 本身进行了联合训练。训练还覆盖了长周期编码任务:整个代码库的生成、大型端到端项目、自动研究,并通过规划、目标条件设定和上下文压缩来维持进展。
此外还有自我改进循环。Muse Spark 1.1 生成了具有挑战性的编码环境和指令遵循模板;随后,模型根据这些要求对候选解决方案进行评分,为 1.2 版本生成了可扩展的训练数据集。新模型正是通过这种方式,学会比前代更精确地遵循复杂指令。
24 小时内核测试
Meta 的案例研究最能体现其长周期主张。该智能体通过 1000 多次工具调用,对 GPU 内核进行了迭代优化,运行时长可达 24 小时。它会编写、编译、剖析,并相对于给定的基线逐步提升内核性能,基准测试基于 NVIDIA Hopper GPU 上的 KDA 和 MLA 内核。
| 工作负载 | 基线 | 智能体的设计 | 关键优化 |
|---|---|---|---|
| KDA | FLA Triton 实现 | 带顺序跨块扫描的分块并行预处理内核 | 在分块中点重新居中门控累积衰减 |
| MLA | PyTorch 参考实现(批次 1,64 个头,序列长度 8192,潜变量 512) | 结合融合与分块的双内核 Triton 流水线 | 将共享的 KV 潜变量同时用作 K 和 V |
该模型被禁止直接导入诸如 FLA 等第三方内核库;它必须运用自身的优化知识,在 Triton 中实现这些算法,而不是封装现有代码。Meta 报告称,该智能体在两种工作负载下均较基线实现了显著改进,但公告中未公布精确数字。
Meta 在智能体竞赛中的位置
Muse Code 问世之际,AI 编程工具正在与物理键盘解耦。Cursor 的云智能体让开发者可以异步派发任务并从任何地方审查结果,Cursor 的 SQLite 重建就展示了这一点。Apple 的 Xcode 27 将 Anthropic、Google 和 OpenAI 的智能体直接引入 IDE。在模型方面,Anthropic 的 Claude Sonnet 5 专为智能体工作流和企业使用而构建。这个领域正在汇聚到同一个问题上:哪款工具可以在没有人在键盘前操作的情况下被信任并持续工作?
Meta 的答案是基础设施。精确重放的事件日志、持久运行的后台智能体,以及与自身工具框架一同训练的模型,都指向同一个目标:让智能体在无人监督的情况下运行数小时,并在故障后自行恢复。这与在单一基准分数上竞争是截然不同的押注,尤其是在旧基准已经饱和且受到污染的当下。
可用性与后续计划
Muse Spark 1.2 今日起在 Muse Code 中提供,并通过 Meta Model API 提供,全球访问范围进一步扩大。Meta 将此次发布描述为“我们迈向前沿的下一步”,并表示更大、能力更强的模型即将问世。
演示视频是个不错的噱头,内核案例研究也值得一读。真正站得住的主张在于可操作性:一个能在崩溃后存活、需要更少干预的智能体,才是开发者愿意托付通宵任务的那一个, , 而信任问题正是 Circle 的智能体栈研究指出的困难部分。Meta 的赌注是,这场竞赛将以可靠性取胜,而它可以通过将产品送到你身边的终端来实现这一点。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。