SevenTnewS

自动驾驶研究

XCoT-VLA:用六个令牌而非整段文字推理的驾驶AI

XCoT-VLA用2至6个可执行令牌取代视觉-语言-动作驾驶模型中的描述式思维链,在满足实时规划预算的同时降低轨迹误差。代价是:压缩良好的推理不再像人类解释。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-18 · 阅读需 4 分钟

XCoT-VLA:用六个令牌而非整段文字推理的驾驶AI

思维链让语言模型能够在回答之前逐步推理。2026年8月11日发布在arXiv上的一篇论文认为,这种习惯并不适合驾驶座。在自动驾驶车辆中,开放式、解码成本高且难以作为面向动作的表示进行优化的推理是一种负担。论文提出的XCoT-VLA方法将驾驶推理压缩为2至6个可执行令牌,直接调节轨迹生成。

视觉-语言-动作模型将场景理解、语义推理和轨迹生成连接起来。这正是它们成为自动驾驶系统候选方案的原因。但当推理层用自然语言叙述时,每增加一个令牌都会增加自回归延迟,而规划预算不会等待。

为什么冗长推理无法满足实时控制

论文指出了描述式思维链在此场景中的三个问题。它是开放式的,因此模型没有自然的停止点。它解码成本高,这在输出进入实时控制回路时至关重要。而且它难以作为动作侧网络可以依赖的表示进行优化。XCoT-VLA的答案是改变表示而非模型:用专为驾驶学习、紧凑的可执行令牌取代解释性理由。

可执行令牌来自日志,而非提示

图表 : 轨迹误差:基线 vs XCoT-VLA
文章报告的轨迹误差显示,XCoT-VLA在变道场景中将横向最终位移误差减少了一半以上。

推理令牌来自Reason-Action监督,自动构建而非手工编写。记录的轨迹提供动作证据;场景上下文提供因果语义。推理时,预测的XCoT序列保持在上下文中,并通过共享的多模态自注意力调节固定的轨迹查询。路由是确定性的:一个Reason前馈网络处理XCoT令牌,一个Control FFN处理轨迹查询,流匹配生成最终轨迹。

数据:更小的误差,更小的推理足迹

在通用分布评估集上,纵向平均位移误差从1.645降至1.323。在车道变更场景中,横向最终位移误差从1.616降至0.648,不到基线的一半。论文将该增益归因于令牌经济性本身:仅用2至6个可执行令牌表示面向驾驶的推理,自回归开销缩减至足以满足实时规划预算。

指标未使用XCoT-VLA使用XCoT-VLA
纵向ADE,通用分布集1.6451.323
横向FDE,车道变更场景1.6160.648

ADE和FDE是标准轨迹指标。平均位移误差衡量预测路径与记录轨迹的平均偏离程度;最终位移误差检查终点,即车道变更中最关键的位置。

摘要报告了这些结果,但没有详细说明评估数据或实验规模。如果该方法从arXiv走向实车,这些细节将变得重要。

XCPO与可读性的权衡

论文还介绍了XCoT策略优化(XCPO),一种可选的优化扩展,在相同的可执行令牌空间内工作。摘要将其描述为在不放弃紧凑表示的情况下改进策略的方法,但没有说明该扩展是如何训练的。

紧凑性有一个论文未详述的代价:可执行令牌不再具有人类可读性。无论延迟问题如何,描述式思维链都留下了人类可以遵循的审计轨迹。在实时预算下优化良好的令牌更难检查。论文将该工作描述为证据,证明面向驾驶的推理可以是紧凑的、可执行的,并直接连接到轨迹生成。它并未声称推理保持可读。

XCoT-VLA也处于更广泛地推动推理比序列化文本更便宜的运动之中。2026年7月的一篇arXiv论文Penelope本地化循环计算以进行结构化推理,正是为了避免生成长篇可见的推理轨迹。Penelope保持推理为潜在状态;XCoT-VLA则保持其显式但最小化,两到六个令牌直接指向动作。共同的前提是:思维链是实现推理的一种方式,而非唯一方式。

压缩的推理是否也值得信赖的推理,仍是未决问题。XCoT-VLA的结果表明,驾驶推理可以简短且可执行。但匹配记录行为的轨迹是唯一可见的产品,而在汽车中,没有人能读到模型的作业。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。