Qwen3.8-Max 开放权重下周上线
阿里巴巴史上最强大的模型将开源
Qwen3.8-Max 是阿里巴巴首款开放权重的 Max 级模型,参数规模 2.4 万亿,将于下周登陆 Hugging Face 和 ModelScope。此次发布重新定义了开源议题:当最前沿的最大权重可被免费下载和测试时,会发生什么?

阿里巴巴最强的模型系列曾经是你无法拥有的。Qwen-Max 系列专为付费云客户打造,即使较小的开放权重 Qwen 模型广泛传播,它依然保持封闭。这堵墙刚刚倒塌。阿里巴巴发布了 Qwen3.8-Max,该公司称这是其家族中迄今能力最强的模型,发布在其云博客的发布帖中。这是一个基于 Qwen 3.5 架构、拥有 2.4 万亿参数、首个开源的 Max 级旗舰模型:权重将于下周登陆 Hugging Face 和 ModelScope。
这篇发布帖基于三次长时间自主运行,每次都有公开轨迹,模型在数天内无需人工帮助即可改进自己的工作。
顶级产品线的开放权重
开源旗舰是很少有实验室会选择的举措,因为将最强权重留在付费 API 之后是前沿 AI 公司保护利润的方式。阿里巴巴将此次发布与产品推广相结合:公司已开放 QwenWork 的测试版,这是一款工作场所智能体平台,将桌面、云端和钉钉协作套件(服务超过 2000 万家企业与组织)统一到一个订阅中。从 8 月 3 日起,Qwen3.8-Max 成为 QwenWork 上重点展示的模型选项,该平台的四个模型层级从 Economy 到 Flagship。
对于开发者来说,新模型会说竞争对手的 API 方言。QwenCloud 提供与 OpenAI 兼容的聊天补全和响应端点,以及与 Anthropic 兼容的接口,因此 Qwen3.8-Max 可以通过几个环境变量在 Claude Code 或 Codex 中运行。reasoning_effort 参数(支持 xhigh、medium 和 low 三个级别)控制模型在回答前进行多少思考,preserve_thinking 默认开启。
四轮迭代击败论文
最详细的证据是研究复现实验。Qwen3.8-Max 拿到一篇题为“Unified Data Selection for LLM Reasoning”的论文,且没有起始代码,它花了大约 37 小时从零重建该流水线,编写了约 7,600 行代码,运行了 33 轮 GPU 训练,并复现了论文的六项主要发现。随后它又用了 88 小时尝试做得更好,在四轮中产生了 18 个想法。获胜的想法(计算模型所称的训练样例中的硬决策点)在 AIME24 数学基准上比论文自身的方法高出 2.7 分。
| 轮次 | 最佳思路 | AIME24 | 相对基线的增益 |
|---|---|---|---|
| 基线 | 论文方法(已复现) | 49.58% | 不适用 |
| 1 | 按难度拆分数据 | 50.42% | +0.84 |
| 2 | 按熵值-得分差距加权样本 | 51.67% | +2.09 |
| 3 | 调整选择宽度 | 51.25% | +1.67 |
| 4 | 计算硬决策点(“nhighgate”) | 52.29% | +2.71 |
另外两次运行遵循同样的模式。在阿里巴巴天池平台的 WWW2025 多模态对话意图识别挑战赛中,该模型微调了多个语言模型,将其合并为加权投票系统,并在 45 次提交中从 0.60 的准确率升至 0.853,最终领先 526 支人类团队中的 458 支。在一次芯片设计练习中,它在大约 500 轮中把 GCD/RSA 加速器从 8,298 门减少到 678 门,物理布局也从 106×106 µm² 缩小到 46×46 µm²。在 oh-my-cli 项目上进行的一次 16 天自主运行累计产生 265 次提交、127 个 PR 和 151 个 issue,全部可见于公开 GitHub 仓库。
自家人给自己打分
这些结果都没有独立审计方。结果来自阿里巴巴自己,最引人注目的结果则来自阿里巴巴设计的基准。在 E-Commerce Bench(一个基于脱敏淘宝和天猫交易数据构建的 365 天业务模拟)上,Qwen3.8-Max 将 ¥100,000 的启动资金变成了 ¥416,252 的余额,4.16 倍回报,该公司称比第二名 GLM 5.2 高出 38%。与 Claude Code 和 Codex 的基准对比同样来自同一篇博客。这些都不能说明结果是假的。它意味着验证的责任落在了其他所有人身上。
开放权重解决了部分问题。一旦下周权重上线,任何拥有足够 GPU 的人都可以重新运行有争议的基准,检验该模型在阿里巴巴自身框架之外是否依然可靠。前沿实验室将最大的权重留在付费 API 之后;阿里巴巴刚刚免费送出了其最好的模型。对 Qwen3.8-Max 的最终评判将来自开源社区,而不是一篇发布帖。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。