Qwen / 阿里巴巴
Qwen3-2507 发布:思维模型与指令模型分道扬镳,回归专门化路线
阿里巴巴 Qwen 团队发布 Qwen3-2507,将模型系列拆分为专门的指令变体和思维变体。此次更新在推理、指令遵循以及 256K 上下文支持(可扩展至 1M tokens)方面带来了实质性改进。
阿里巴巴 Qwen 团队正在收回其统一模型的赌注。新的 Qwen3-2507 版本将产品线拆分为两个不同的变体:一个针对指令遵循和通用聊天进行了优化,另一个专门为数学、科学和编程等重度推理任务而构建。
这一举措标志着与 Qwen3-2504 的明显背离, , 后者采用单一架构,可根据查询在思维模式和非思维模式之间切换。新的版本承认,万金油方法迫使两个用例都接受本不需要的权衡。
两个模型,两套任务

Qwen3-Instruct-2507 侧重于广度。团队宣称在指令遵循、逻辑推理、文本理解、数学、科学、编程和工具使用方面取得了进步。它还声称在多种语言的长尾知识覆盖以及主观、开放式任务、创意写作、角色扮演和多轮对话的对齐方面表现显著改善。上下文支持为 256K tokens,可扩展至 1M。
Qwen3-Thinking-2507 专攻推理深度。该发布称其“在通常需要人类专业知识的基准测试中,是开源思维模型中最先进的”,这些基准包括逻辑推理、数学、科学、编程和学术考试。它也享有同样的 256K 上下文上限,可扩展至 1M。
这种拆分反映了更广泛的行业波动。今年早些时候,趋势青睐可以决定何时深入思考、何时快速回答的混合模型。但现在越来越多的实验室得出结论,在单一权重集内部切换模式的认知开销会削弱两端的性能,这使得专门的变体成为生产部署中更清晰的工程选择。
Qwen3-2504 现在的定位
早期的 Qwen3 版本并未被淘汰。团队仍维护着参数范围从 0.6B 到 235B-A22B 的密集和 MoE 模型,并保留其标志性的在思维模式与非思维模式之间无缝切换的能力。对于那些需要单个模型同时处理重度推理和快速聊天、而无需管理两个推理端点的部署来说,Qwen3-2504 仍然是正确的选择。
但对于明确知道自己需求的团队来说,Qwen3-2507 消除了猜测。指令变体针对帮助性、创造性和广度进行了优化。思维变体则针对深度、精确性和基准表现进行了优化。入门的代价是在推理前做出选择,而不是让模型在运行中决定。
- 来源 : Qwen documentation
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。