SevenTnewS

开源AI

Qwen3.8-Max 在24小时内独自击败458支人类团队

Qwen3.8-Max在24小时竞赛中独自击败了526支人类团队中的458支,阿里巴巴将于下周开源其权重。到目前为止,每一个数字都是自我报告的,这正是自主性主张值得审视的原因。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-03 · 阅读需 5 分钟

Qwen3.8-Max 在24小时内独自击败458支人类团队
来源 : Qwen3.8-Max: A …·Seventnews inte…

阿里巴巴Qwen团队于8月2日发布了Qwen3.8-Max,这是一个2.4万亿参数的模型,该团队称其为系列中最强大的。开放权重是Max级模型首次,将于下周发布。但此次发布的真正新闻是一系列关于该模型在无人监督情况下做了什么的说法:让一个软件项目运行超过十天,从头复现一篇研究论文并随后超越它,并在526支人类团队中领先于大多数队伍。

这些说法比通常的基准测试表更有分量,因为它们描述了持续的自主工作,而正是这类工作决定了当今的模型在演示之外是否真正有用。此外,这些说法目前完全是自我报告的。该公司并不隐瞒这些是其自身的测试;独立验证尚未跟上。请在阅读下文时记住这一张力。

三次无人观看的运行

Qwen为该模型设定了三项挑战,每项持续数天,均涉及工具使用、自我纠错和重新规划。三项挑战的规则相似:模型在开始时没有代码,也没有人工引导,每一个结果都必须通过编写和运行软件来获得。

任务运行时长Qwen报告的结果
构建oh-my-cli项目和自进化框架10多天运行约16个自主日后:265次提交、127个PR、151个issue
复现一篇研究论文,然后加以改进约125小时7,600行代码,33轮GPU训练,在AIME24上比论文的方法高2.7分
与526支人类团队同场竞赛24小时击败458支团队(87%),准确率从0.60提升到0.853

竞赛案例值得读两遍。模型阅读了竞赛规则,选择了要微调的模型(用于文本的BERT、MacBERT和RoBERTa,用于截图的Qwen2.5-VL-7B),并将它们融合成一个加权投票系统。它的45次提交中的每一次都引导了下一轮训练,将准确率从0.60推至0.853,并超过了526支人类团队中的458支,即87%的队伍。该公司所宣传的模式并不是一次巧妙的运行,而是一个不断自我改进的循环。

开放权重改变了局面

此前,Max级别是Qwen产品线中闭源的部分。Qwen3.8-Max打破了这一点:团队表示权重将于下周在Hugging Face和ModelScope上发布,这是Qwen Max级模型的首次开放权重发布。在2.4万亿参数中激活950亿参数的情况下,开源标签现在延伸到了一款为多日智能体运行而设计的模型,而不仅仅是聊天。

此举符合阿里巴巴更广泛的战略。该公司将其AI工作整合到一个单一业务部门,其使命,用该公司自己的话说,是"create, deliver, and apply tokens",并受到530亿美元投资计划的推动;而且它一直在发布一系列模型,而不是一个单一的旗舰模型。Qwen3.7-Max于5月发布,是之前的旗舰;Artificial Analysis的独立基准测试显示,它优于中国领先的竞争对手,并可与全球顶级系统相媲美。Qwen3.8-Max是这条道路上的下一步,开放权重作为差异化因素加入。

自我报告的问题

诚实的告诫:发布中的几乎每一个数字都来自构建该模型的团队。一些竞争对手模型的基准行在没有已发表分数的地方留空,所用的测试框架在各行之间也不总是一致。在发布方展示的重点表格上,Qwen3.8-Max针对指名前沿竞争对手的最强成绩是:PaperBench 93.0分,高于GPT-5.6 Sol的90.5分;以及MRCR v2的8针变体在256K上下文下的92.9分。这些是厂商数字,但它们是精确的厂商数字。

最长的运行是最难验证也最引人注目的。给定一个初始工作区和一个评估脚本,该模型在约500轮中重新设计了密码加速器,将综合门数从8,298降至678,将布局后的芯片尺寸从106微米×106微米降至46微米×46微米,面积缩小81%,同时在500 MHz下满足时序收敛。公布的里程碑读起来像工程师日志:替换模数除法器、削减位宽、精简状态机、合并模块、压缩门电路。在一个基于淘宝和天猫交易数据的365天模拟电子商务基准测试中,它最终获得了¥416,252的余额,比第二名高出38%。

第三方进行一次为期十天的自主会话,并发布完整轨迹,才能对这类说法作出定论。Qwen团队在一个案例中退而求其次:oh-my-cli构建的完整项目历史已在GitHub上公开,因此每一次提交、拉取请求和issue都可核查。

随附内容

在API方面,Qwen3.8-Max支持一个reasoning_effort参数,具有三个级别(xhigh、medium、low),并默认保留思考输出。它通过兼容OpenAI和Anthropic的端点接入Claude Code、Codex、Qoder、Qwen Code和OpenClaw。新库Qwen-MM-Plugins为现有智能体框架添加了图像和视频处理功能,团队还引入了RecreationBench,这是一个用于重建那些仅在五个平台上作为黑箱观察到的真实应用的基准。

接下来一个月的问题是,这种自主性在Qwen自己的沙盒之外是否依然成立。独立实验室将回答这个问题。与此同时,此次发布之所以重要,原因更为简单:阿里巴巴正在押注,开放权重, , 而不仅仅是API访问, , 是将多日自主智能体推向世界所需要的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。