SevenTnewSAI 与科技新闻,深度解读

Qwen / 阿里巴巴

Qwen3.8-27B 能读取 100 万 token,但前提是开启正确的标志

Qwen3.8-27B 配备了推理努力度调节旋钮和 262K 原生上下文,在正确的标志下可扩展到 100 万 token。阿里巴巴指南中隐藏的一个问题是:将思考调低可能会拖慢智能体流水线。以下介绍这些标志的作用,以及低努力在什么情况下会适得其反。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-18 · 阅读需 3 分钟

Qwen3.8-27B 能读取 100 万 token,但前提是开启正确的标志

推理更少的模型应该回答得更快。阿里巴巴自己的 Qwen3.8-27B 实用指南,发布在阿里云博客上,警告说这个假设在智能体(agent)场景下并不成立:“在多轮智能体任务中,较低的努力程度并不总是意味着端到端更快。”更快的单轮响应可能带来更多失败和重试,这会让总延迟和 token 消耗上升。这个看似速度控制的旋钮实际上是一个预算控制,而厂商在其发布材料中也是如此说明的。

上述警告背后的模型是一个基于 Qwen3.5 架构的密集 27B 模型,具备原生的视觉-语言理解能力。阿里巴巴称其紧凑且易于部署,并且默认在回答前会进行思考。对开发者来说,新变化是 OpenAI 兼容的 Chat Completions API 正式支持 reasoning_effort 参数,设有三个级别:xhigh、medium 和 low,这样团队可以在准确性与每次请求的速度和成本之间取得平衡。

API 实际暴露的思考预算

两个聊天模板标志随附其中:enable_thinking 和 preserve_thinking,默认均为开启。推理深度成为运行时决策,这对智能体工作负载很重要。同一个端点可以以 low 努力级别回答一个琐碎问题,也可以在 xhigh 下完成一项困难的重构,而无需启动第二个模型。阿里巴巴的建议是选择适合任务的努力级别。它自己的警告解释了为什么最便宜的设置往往不是最快的。

262,144 个原生 token,通过 YaRN 扩展到 100 万

上下文是另一半内容。Qwen3.8-27B 原生支持最长 262,144 个 token 的上下文。当总长度(输入加输出)超过该值时,模型需要进行 RoPE 缩放,受支持的路径是 YaRN,可在 vLLM、SGLang 和 TokenSpeed 中使用。对于 vLLM,该指南提供了一行启动命令,将最大模型长度设为 1,000,000,并覆盖 rope 参数,包括 yarn 模式、theta 设为 10,000,000、partial rotary factor 设为 0.25,以及 scale factor 设为 4.0:

VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ..., hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}', max-model-len 1000000

同样的参数可以直接放入模型 config.json 的 text_config 部分,这适合 Unsloth 等引擎。无论哪种方式,一百万 token 都不是一个勾选项:模型和服务栈必须就扩展位置编码达成一致,而这个决定应该在评审中作出,而不是在初步沟通中。

上下文设置上限所需条件
原生262,144 tokens无需配置
YaRN 缩放1,000,000 tokens启动标志或 config.json 修改,以及支持 YaRN 的引擎

为什么低努力设置会让智能体变慢

一旦你运行过智能体,这个警告背后的机制就很好理解。低努力会产生廉价、快速的答案,但出错频率更高。聊天中一个错误答案意味着一次重试。智能体内部的一个错误答案会触发重新规划、额外的工具调用和状态恢复,所有这些都会消耗 token 和实际用时。单轮节省下来的资源消失殆尽,整个循环最终比使用中等努力设置更慢、更昂贵。

该模型发布之时正逢一场企业级推广。2026 年 8 月 26 日在香港举行的 Qwen 大会以“QwenCloud:面向智能体时代构建的 AI 原生云”为主题,吸引了超过 300 名企业客户和开发者。来自影视制作和金融服务领域的十余条合格线索在现场登记了兴趣。一个可控制思考的 27B 密集模型与这一理念契合:它面向真实工作负载,而不是基准测试标题。

阅读这份指南,只需记住一句话。看起来更便宜的设置最终可能花费更多,既体现在延迟上,也体现在 token 上。很多发布文章会把这句警告粉饰掉。阿里巴巴保留了它,而运行智能体的团队正是受益者。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。