开源AI:阿里巴巴开放Max层级
Qwen 3.8-Max:阿里巴巴最强大模型现已开放免费下载
阿里巴巴正在开源其有史以来最强大的模型Qwen 3.8-Max:一款2.4T参数的MoE模型,在SWE-bench Pro、PaperBench和IFBench上超越GPT-5.6 Sol。我们解析了基准测试的注意事项,以及95B活跃参数的开源旗舰对开发者意味着什么。

Max层级一直是Qwen中无人能够下载的部分。阿里巴巴的旗舰模型仍然留在API之后,而较小的版本则开放权重。Qwen 3.8-Max终结了这一局面。发布公告称它是Qwen家族迄今最强大的模型,也是首个开放权重的Qwen-Max级版本,通过Hugging Face和ModelScope发布,这一转变我们在发布前就已预警。该模型总参数达2.4万亿,每个token激活950亿参数,基于Qwen 3.5引入的架构。
它在闭源时代已经积累了成绩。在24小时内,Qwen 3.8-Max独自击败了458个人类团队,详见24小时竞赛报道。随后是一次16天的自主运行,产出了一个智能体框架,并在Vision Arena中排名第二,记录在16天运行报道中。这些能力即将在任何能够运行该模型的地方复现。
阿里巴巴闭源的Max层级刚刚开源
这是一次战略转向,而非善意姿态。阿里巴巴已将其AI工作整合为一个单一部门,其既定使命是“创造、交付和应用token”,背后有530亿美元的投资推动,详见我们对这笔支出的分析。该公司发布的是一个模型舰队,而非单一冠军,这是我们在早前战略分析中梳理过的平台打法,而这里的交易很清楚:权重免费,而Qwen Cloud及周边的服务工具链才是付费渠道。根据Qwen Cloud套餐报道,该付费渠道现在将文本、视觉、语音和图像模型捆绑在一个订阅之下。有一个细节对任何计划运行旗舰模型的人都至关重要:开放的2.4T变体Qwen3.8-2.4T-A95B仅支持文本,且每次交互都需要思考模式。多模态输入不受支持,思考模式也无法关闭,尽管其底层的Qwen 3.5基础模型是作为统一视觉语言模型训练的。
Qwen 3.8-Max在哪里胜过GPT-5.6 Sol,在哪里落败
根据公告中的数据,Qwen 3.8-Max几乎在每一行上都超越了其前代。面对闭源对手,胜利是真实的但并不均衡。它在PaperBench(93.0,领先GPT-5.6 Sol的90.5)、指令遵循(IFBench 82.8对比72.7)和计算机使用(OSWorld-Verified 86.1)上取得最高分,并在SWE-bench Pro上以67.7对64.6险胜GPT-5.6 Sol。在其他基准上,领先地位发生逆转。Fable 5在同一基准上以80.0保持大幅领先,GPT-5.6 Sol在Terminal Bench 2.1上以88.8对86.6占据榜首,而在GPQA Diamond上最高分是GPT-5.6 Sol的94.1。
| 基准测试 | Qwen 3.8-Max | Qwen 3.7-Max | GPT-5.6 Sol | Fable 5 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 74.5 | 88.8 | 84.6 | 84.6 |
| SWE-bench Pro | 67.7 | 60.6 | 64.6 | 80.0 | 69.2 |
| DeepSWE 1.1 | 56.6 | 21.6 | 73.0 | 70.0 | 59.0 |
| PaperBench | 93.0 | 64.8 | 90.5 | 88.8 | 80.3 |
| GPQA Diamond | 92.6 | 92.4 | 94.1 | 92.6 | 92.0 |
| IFBench | 82.8 | 79.1 | 72.7 | 63.5 | 62.2 |
分数由Qwen团队发布。根据公告的脚注,Fable 5的结果可能涉及回退机制。
细读各行,一个模式浮现出来:Qwen在指令遵循、论文复现和计算机使用方面领先,而仓库级软件工程和硬推理仍偏向闭源模型。SWE-bench Pro基线也是该团队自己的修正版本,修复了有问题的任务,并让每个竞争对手都在精炼后的基准上重新评估。当与GPT-5.6 Sol的差距仅有3.1分时,这一细节至关重要。
一个每个token激活950亿参数的2.4T模型
A95B后缀对任何托管该模型的人来说都是关键数字。混合专家设计在2.4万亿参数中每个token激活950亿参数,而服务成本追踪的正是这个激活数量。这也是让如此规模的模型在实验室之外具有实用性的原因;大部分参数保持休眠状态。Qwen 3.5系列贡献了Gated Delta Networks及稀疏MoE,团队将其归功于以极低延迟开销实现高吞吐推理。上下文长度达到100万token,推荐输出预算为262,144个推理token和131,072个最终token。同一版本还包含一个270亿参数的兄弟模型Qwen3.8-27B,规模约为其1/90。
效率压力落在了服务引擎上。团队推荐使用SGLang、vLLM或TokenSpeed来处理生产工作负载,这与Aleph Alpha近期工作瞄准的领域相同:其megakernel库报告称,在vLLM和SGLang中运行的FP8 MoE模型推理速度最高提升200%。随着如此庞大的权重现在开放,决定谁能真正使用该模型的将是推理效率,而非参数数量。
智能体提升背后的测试框架注意事项
最引人注目的是智能体能力的跃升:DeepSWE 1.1从21.6攀升至56.6(对比Qwen 3.7-Max),OSWorld-Verified从73.3升至86.1,Agents' Last Exam通过率从11.8升至27.0。脚注与分数同样值得关注。多行中的Qwen运行使用Claude Code测试框架,竞争对手使用其官方框架(GPT-5.6 Sol搭配Codex,Claude模型的Terminus 2分数来自Artificial Analysis),且多个基准是内部开发的:QwenSWEBench、QwenQoderBench、CoWorkBench等。对于SkillsBench,团队明确表示所有结果均来自其自身测试。Fable 5的数字“可能涉及回退机制”。
这一披露异常坦诚,但这仍然是供应商在部分由其控制的基准上,针对闭源对手进行的供应商自营评估。基准编码与生产之间的差距并不新鲜:正如我们对Pro变体的报道所示,顶级模型在SWE-bench Verified上超过96%,但在私有企业代码上仅勉强达到23%。我们报道过的关于测试框架演进的研究,使用GPT-5.4和Claude Opus 4.6在Terminal-Bench 2.1上测试,提出了一个疑问:通过测试框架迭代发现的改进能否在保留任务上存续。同样的疑问也悬在Qwen在SWE-bench Pro上的微弱领先之上。
开发者实际能用开放权重运行什么
已发布两个模型ID:Qwen/Qwen3.8-2.4T-A95B和Qwen3.8-27B,可从Hugging Face或ModelScope下载。无法访问Hugging Face的用户可以通过环境变量切换,如SGLANG_USE_MODELSCOPE或VLLM_USE_MODELSCOPE。部署层一直在追赶:Hugging Face围绕vLLM、SGLang、llama.cpp和带自动伸缩的自定义容器重构了其Inference Endpoints,这为95B激活的MoE模型提供了一条无需定制技术栈的商品化托管路径。
此次发布延续了Qwen的目录策略。其在Hugging Face上的布局横跨七个能力领域,从语言到语音、图像、智能体推理和安全对齐,且该家族在低调的、非主舞台的发布中持续壮大。团队习惯性地随权重一同发布训练数据、评估框架和奖励模型。开源旗舰改变了这一习惯的价值:一个在PaperBench、IFBench和OSWorld-Verified上取得最高分的模型,如今附带权重,这是其闭源对手尚未做到的。
悬而未决的问题是这些胜利能否经得起第三方验证。脚注在测试框架和内部测试方面表现出真正的坦诚。但Qwen 3.8-Max击败GPT-5.6 Sol的那些行,是由训练该模型的团队测量的,而此前最强的独立检验, , Artificial Analysis对Qwen 3.7-Max的评估, , 来自上一代。在独立测试落地之前,阿里巴巴有史以来最大规模的开源权重发布,所依赖的数字大部分是其自己记录的。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。