自动驾驶研究
XCoT-VLA:用六个令牌而非整段文字推理的驾驶AI
XCoT-VLA用2至6个可执行令牌取代视觉-语言-动作驾驶模型中的描述式思维链,在满足实时规划预算的同时降低轨迹误差。代价是:压缩良好的推理不再像人类解释。

思维链让语言模型能够在回答之前逐步推理。2026年8月11日发布在arXiv上的一篇论文认为,这种习惯并不适合驾驶座。在自动驾驶车辆中,开放式、解码成本高且难以作为面向动作的表示进行优化的推理是一种负担。论文提出的XCoT-VLA方法将驾驶推理压缩为2至6个可执行令牌,直接调节轨迹生成。
视觉-语言-动作模型将场景理解、语义推理和轨迹生成连接起来。这正是它们成为自动驾驶系统候选方案的原因。但当推理层用自然语言叙述时,每增加一个令牌都会增加自回归延迟,而规划预算不会等待。
为什么冗长推理无法满足实时控制
论文指出了描述式思维链在此场景中的三个问题。它是开放式的,因此模型没有自然的停止点。它解码成本高,这在输出进入实时控制回路时至关重要。而且它难以作为动作侧网络可以依赖的表示进行优化。XCoT-VLA的答案是改变表示而非模型:用专为驾驶学习、紧凑的可执行令牌取代解释性理由。
可执行令牌来自日志,而非提示

推理令牌来自Reason-Action监督,自动构建而非手工编写。记录的轨迹提供动作证据;场景上下文提供因果语义。推理时,预测的XCoT序列保持在上下文中,并通过共享的多模态自注意力调节固定的轨迹查询。路由是确定性的:一个Reason前馈网络处理XCoT令牌,一个Control FFN处理轨迹查询,流匹配生成最终轨迹。
数据:更小的误差,更小的推理足迹
在通用分布评估集上,纵向平均位移误差从1.645降至1.323。在车道变更场景中,横向最终位移误差从1.616降至0.648,不到基线的一半。论文将该增益归因于令牌经济性本身:仅用2至6个可执行令牌表示面向驾驶的推理,自回归开销缩减至足以满足实时规划预算。
| 指标 | 未使用XCoT-VLA | 使用XCoT-VLA |
|---|---|---|
| 纵向ADE,通用分布集 | 1.645 | 1.323 |
| 横向FDE,车道变更场景 | 1.616 | 0.648 |
ADE和FDE是标准轨迹指标。平均位移误差衡量预测路径与记录轨迹的平均偏离程度;最终位移误差检查终点,即车道变更中最关键的位置。
摘要报告了这些结果,但没有详细说明评估数据或实验规模。如果该方法从arXiv走向实车,这些细节将变得重要。
XCPO与可读性的权衡
论文还介绍了XCoT策略优化(XCPO),一种可选的优化扩展,在相同的可执行令牌空间内工作。摘要将其描述为在不放弃紧凑表示的情况下改进策略的方法,但没有说明该扩展是如何训练的。
紧凑性有一个论文未详述的代价:可执行令牌不再具有人类可读性。无论延迟问题如何,描述式思维链都留下了人类可以遵循的审计轨迹。在实时预算下优化良好的令牌更难检查。论文将该工作描述为证据,证明面向驾驶的推理可以是紧凑的、可执行的,并直接连接到轨迹生成。它并未声称推理保持可读。
XCoT-VLA也处于更广泛地推动推理比序列化文本更便宜的运动之中。2026年7月的一篇arXiv论文Penelope本地化循环计算以进行结构化推理,正是为了避免生成长篇可见的推理轨迹。Penelope保持推理为潜在状态;XCoT-VLA则保持其显式但最小化,两到六个令牌直接指向动作。共同的前提是:思维链是实现推理的一种方式,而非唯一方式。
压缩的推理是否也值得信赖的推理,仍是未决问题。XCoT-VLA的结果表明,驾驶推理可以简短且可执行。但匹配记录行为的轨迹是唯一可见的产品,而在汽车中,没有人能读到模型的作业。
- 来源 : XCoT-VLA: driving AI that reasons in six tokens, not a paragraph — 2026-08-11
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。