SevenTnewSAI 与科技新闻,深度解读

自动驾驶研究

Qwen-Drive-1.0 在驾驶问答上取得 69.43 分,随后自行指出其推理缺口

Qwen-Drive-1.0 在未改动的 Qwen3.5-4B 主干上外挂了鸟瞰图感知头和流匹配规划器,随后公布 69.43 的驾驶问答平均分。论文自己的结论指出了这一分数所掩盖的问题:推理并不总与轨迹相符。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-15 · 阅读需 5 分钟

Qwen-Drive-1.0 在驾驶问答上取得 69.43 分,随后自行指出其推理缺口

Qwen-Drive-1.0 的摘要声称拿下了一个类别内的“首次”:首个在预训练阶段就统一 3D 感知与视觉问答、并进一步扩展到运动规划的自动驾驶视觉语言基础模型。剥去这层包装,其贡献会收窄为更具体的东西。三项能力共用同一个预训练 VLM:感知由外挂的鸟瞰图(BEV)头负责,问答走语言通路,轨迹生成则交给一个独立专家模块。

一个在结论中被收回的“首次”

结论部分的措辞比摘要更柔和。在结论中,同一项工作被称为“迈向自动驾驶视觉语言基础模型的第一步”。两句话出现在同一篇论文里。区别它们的是实际被展示出来的范围有多大。

所提供的材料中没有说明有多少系统被拿来做对比测试。论文报告称,其 Qwen-Drive-1.0-SFT 变体在驾驶问答上领先于通用 VLM 以及驾驶或具身领域的专用模型,但此处可获得的摘录没有点名其中任何一个。

一个冻结的主干,以及两个从中读取的模块

Qwen-Drive-1.0 基于 Qwen3.5-4B,论文称其原生具备多模态能力。一个共享的视觉编码器与 VLM 处理单视图和多视图驾驶图像、时序图像序列以及通用图像。两个外部模块从这一共享通路中读取信息,而预训练架构保持原样。

第一个是 BEV 感知头。它从多视图单帧输入构建鸟瞰图表示,负责 3D 目标检测、语义占用预测和 BEV 地图分割。论文称其为一个显式、可检视的 3D 探针,而它所提出的架构主张比“头”这个词所暗示的更强。在联合训练中,它的损失会向共享视觉通路注入一条额外的梯度路径,因此感知头会反向写入它所读取的特征。

这一细节与架构被“完全未改动”的说法存在轻微张力。架构和权重是两回事,梯度可以改写权重而不改变拓扑结构,因此两种说法可以同时成立。论文没有说明它想表达的是哪一种读法。

第二个模块是规划专家(Planning Expert),一个为 VLM 表示量身定制的扩散 Transformer,通过流匹配生成 5 秒的自车轨迹。它将文本形式的规划理由作为可选条件,这意味着语言可以引导某个机动动作,但并非生成路径所必需。

69.43 和 283 万究竟说明了什么

报告的数字数值论文为其附加的说明
驾驶问答平均分(Qwen-Drive-1.0-SFT)69.43领先于通用 VLM 以及驾驶或具身领域的专用模型,但现有摘录未点名其中任何一个
训练样本283 万全部为公开数据
轨迹时长5 秒以 10 Hz 频率预测
外部模块2BEV 感知头与规划专家
基础模型Qwen3.5-4B原生多模态;预训练架构未改动

Qwen-Drive-1.0-SFT 的驾驶问答平均分达到 69.43,保留到小数点后两位。所提供的材料没有按基准给出细分数据,因此无从看出是哪些题型撑起了这一平均分、哪些拉低了它。不同数据集的标注风格各异,团队对轨迹格式做了统一,以输出稳定的 10 Hz、5 秒预测。

全部 283 万条训练样本都来自公开数据,这意味着不涉及专有车队日志,原则上其他实验室也可以尝试复制这套配方。基础模型的规模才是这项主张有意思的地方。论文并未论证是更大的主干带来了这些提升,而是主张分阶段训练加上两个专用模块,把一款通用模型在其所运行的评测上推到了领先的驾驶问答平均分。

两个并不一致的输出

论文自己点出了失效模式:“文本推理与生成轨迹之间的一致性仍有待加强,我们将其留作未来工作的重点。”

这句话应该与每一条 69.43 的标题一同出现。一个模型若给出流畅的减速理由、轨迹却做了别的事,会比完全不提供理由的模型更难审计,因为解释会招来路径本身尚未赢得的信任。

对任何在此基础上做开发的人来说,后果是具体的。轨迹可以用仿真器校验,句子不行。在两者实现相互验证之前,对这类系统的监督只能退回到仅依赖轨迹,语言输出则始终是一种便利,而非审计线索。

为什么要做驾驶基础模型,又为何以这种方式打包

这篇论文出现在一批阿里云材料之中,其中 Qwen 是被商业化推介的:一个可在包括 Qwen-Max 在内的模型上构建应用的平台、一款名为 QwenWork 的办公工具,以及一则关于保诚(Prudential)的 AI 核保系统运行在阿里云上的案例。对争取企业客户的厂商而言,把研究论文与产品页面并置发布是常规做法,而所提供的材料并未说明任何战略意图。

论文对方向的表述更窄,也更有用。它把这一定位为“面向驾驶场景适配的新一代 VLM 基座”。可供适配的基座是留给其他团队微调的东西,而不是一套完成的驾驶栈,结论中“第一步”的措辞也排除了更强的那种解读。公开数据的约束与这一定位相符。283 万条可检视的样本让训练配方具备车队日志永远无法企及的可复现性。

未完成的部分仍然是最重要的部分。一个尚无法把推理与路线绑定在一起的统一模型,已经证明同一个 VLM 可以在同一套权重中承载感知、问答和规划。它尚未证明这三者彼此一致, , 而这恰恰是驾驶系统真正必须做对的事。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。