SevenTnewS

AI模型

Macaron-V1-Venti的748B四专家设计击败GPT-5.5和Opus 4.8

来自MindLab Research的Macaron-V1-Venti在个人智能、编码、终端使用和生成式UI的基准测试中领先,采用新颖的混合LoRA架构,使模型保持紧凑同时具备专业性。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-27 · 阅读需 3 分钟

Macaron-V1-Venti的748B四专家设计击败GPT-5.5和Opus 4.8
来源 : Macaron-V1-Vent…

MindLab Research发布了Macaron-V1-Venti,这是一个7480亿参数的模型,在涵盖个人智能、编码、终端工作流和生成式UI的一系列基准测试中占据榜首。该模型在MIT许可下发布,是第一个在GLM-5.2上进行后训练的模型,并采用混合LoRA(MoL)架构,将专业知识分散到四个专家模块中,而不是依赖单一的密集网络,这与类似的多专家方法相呼应。

四个专家而非一个

MoL设计将744B参数的GLM-5.2基础模型与四个1B参数的LoRA适配器配对,每个适配器负责一个领域:聊天、智能体、编码和GenUI。路由器为每个传入请求选择合适的专家。这保持了紧凑的活动参数数量,同时仍然能够访问深度专业知识。该方法与典型的混合专家设计不同,它使用LoRA适配器,训练和交换成本更低,并凸显了模型路由的真实成本

Macaron-V1-Venti是早期Macaron-V1-Preview的继任者,并扩展了个人智能体任务和生成式UI的训练。后训练管道使用MindLab的MinT和MindForge系统,旨在使模型与用于智能体工作流的生产环境保持一致。该模型支持100万个token的上下文长度,这得益于名为LongStraw的长上下文训练基础设施,该设施能够处理数百万token的强化学习运行。

全面领先的基准测试

报告结果显示,与GLM 5.2、GPT 5.5、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max和Minimax M3相比,Macaron-V1-Venti在十个基准测试中有七个领先或持平。在ChatBench上,它得到58.3分,而GPT 5.5为55.5分,Claude Opus 4.8为52.8分。在衡量现实世界智能体任务的LivingBench上,它达到64.0分,领先于Claude Opus 4.8的63.8分和GPT 5.5的61.9分。该模型在编码基准测试上表现强劲:在SWE Verified上获得85.6分,仅次于Claude Opus 4.8的88.6分;在TerminalBench 2.1上以87.6分领先,远高于GPT 5.5的83.4分和Claude的78.9分,Claude Opus 5的基准定位提供了对比。

最大的差距出现在UI4ABench上,Macaron-V1-Venti得分为87.8分,远高于GPT 5.5的72.1分和Claude Opus 4.8的75.9分。该基准测试生成式UI,即模型根据自然语言指令生成用户界面的能力。GenUI专家模块似乎在这里给了它明显的优势。在衡量工具使用能力的PinchBench上,Macaron-V1-Venti得分为94.0分,领先于Qwen 3.7 Max的93.4分和Claude Opus 4.8的91.8分。

在衡量通用智能体性能的ClawGym上,Macaron得分为77.7分,落后于GPT 5.5的82.5分和Claude Opus 4.8的80.5分。在更具挑战性的软件工程基准测试DeepSWE上,它得到58.4分,落后于GPT 5.5的70.0分,这表明虽然它的编码专家在标准任务上表现出色,但复杂的多步修复仍然是一个弱点,这一模式也在智能体遭遇创造力瓶颈中可见。

数据对方法的启示

MoL架构的优势在最专门的基准测试中最为明显。编码专家使Macaron在SWE Verified和TerminalBench上领先GPT 5.5,GenUI专家在UI4ABench上创造了巨大差距。但在更通用的基准测试(如ClawGym)上,可能需要动态切换或多领域推理,模型则落后。L0路由器预先决定,当请求需要来自多个专家的知识时,当前设计不会在单次交互中合并它们。

MindLab含蓄地承认了这一局限性:模型卡指出,正在进行的推理和工具交互仍保留在所选LoRA内,而已完成的工作可以通过简洁的摘要跨专家共享。这表明协作是可能的,但不是单次交互中的实时协作。

开源与可用性

该模型在MIT许可下发布,这一举措与开放权重论据一致,尽管模型卡警告用户要尊重从GLM-5.2及其依赖项继承的任何要求。Macaron-V1-Venti可在Hugging Face上获取,并可通过托管API访问,地址为mintcn.macaron.xin,该API支持兼容OpenAI的聊天补全。对于自托管部署,MindLab提供了一个混合LoRA服务框架,在保持端点兼容OpenAI的同时,添加了路由器和服务器端LoRA元数据。

一个名为Macaron Artifacts的配套工具允许用户查看生成的UI和会话,并可作为插件安装在Claude Code、Codex和Kimi Code中。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。