多模态AI
为什么视觉语言模型需要一个视觉中继窗来停止幻觉
新研究揭示了VLM中稳定三阶段多模态注意力再分配,并将其操作化为视觉中继窗(VRW)。TRACE框架使用轻量级训练模块按任务调度此窗口,在接地敏感基准测试中平均提高4.33个百分点,最高达6.6个百分点。

目前,视觉语言模型在回答关于图像的问题方面表现相当不错。但当它们产生幻觉,描述不存在的对象或搞错空间关系时,这通常不是因为视觉信息缺失。模型只是在其推理栈内部的某个地方丢失了它的轨迹。
来自同济大学和香港理工大学的新研究,发表在arXiv上,提供了关于这一现象如何发生以及如何应对的最详细机制解释。作者们确定了VLM Transformer层中三阶段的内部节奏,将关键的中间阶段形式化为视觉中继窗(VRW),并引入了一个名为TRACE的轻量级推理时控制框架,该框架根据每个问题的需要自适应地调度这个窗口。
多模态注意力的三阶段节奏
研究人员跟踪了十种开源权重VLM(包括Qwen-VL、InternVL和LLaVA的变体)各层中的两个注意力探针。第一个探针测量了答案token回溯到问题的强度。第二个探针测量了视觉token之间相互注意的强度。他们发现所有模型中都存在一致的模式:早期层强调基于问题的组织,中间层转向视觉内部整合,后期层返回答案形成。
这个中间阶段,即视觉中继窗,是视觉证据在移交给语言侧进行推理之前被主动组装的地方。其几何形状不是固定的。像计数这样需要细节的任务往往需要更长且更晚的中继窗口,而高层推理任务则受益于更早的移交。
为什么会出现无依据的答案
该研究证明了中继错配与幻觉之间的因果联系。使用HaloQuest基准测试,作者比较了从相同图像-问题对生成的接地和无依据的延续。无依据的答案始终显示更窄的中继窗口、更早的中继终止以及移交后更弱的视觉锚定。在一个修补实验中,用接地分支激活替换估计VRW内的视觉token残差激活,在41.4%的无依据情况下恢复了正确响应。相比之下,中继前修补仅恢复了8.7%,中继后修补恢复了11.2%。
同一基础模型的思维变体(例如,Qwen3-VL-4B Instruct vs. Thinking)显示了更好的任务需求中继对齐和更强的移交后锚定。这表明它们的优势部分来自于更适当的视觉证据内部调度。
TRACE:无需重新训练模型即可调度视觉支持
基于这些发现,团队构建了TRACE(任务自适应中继锚定和受控证据调度)框架,对于4B模型仅有199,244个可训练参数,对于8B模型仅有297,548个。它分三个阶段工作。一个轻量级MLP从预填充时注意力统计数据预测每层的中继分数。一个任务感知调度器通过向视觉到视觉注意力logits应用软偏置来扩展或收缩中继窗口。一个移交后锚定模块在答案生成期间保持对选定视觉支持的访问,其强度由解码不确定性调制。
这些模块通过VRW估计器诱导的伪标签进行训练,保持基础VLM冻结。训练大约需要8小时,使用四块NVIDIA RTX 5090 GPU。
结果:无权衡的接地增益
TRACE在四个开源权重的骨干网络(Qwen3-VL-4B/8B和InternVL3.5-4B/8B)上进行了评估,涵盖七个基准测试,涉及文档理解、视觉推理和幻觉敏感设置。在接地敏感基准测试(HallusionBench、VlmsAreBlind、CountBench)上,平均提高了4.33个百分点,在InternVL3.5-8B的HallusionBench上最高达6.6个百分点。它还改进了像MathVista这样重在推理的基准测试,表明该机制通过单一的底层控制原则同时解决了幻觉和逻辑推理。
与八个基线方法(包括思维链提示、视觉对比解码以及几种注意力重分配和激活引导方法)相比,TRACE在每个骨干网络上均取得了最高平均得分,在整个基准套件上相对于普通推理的总增益为2.84到3.18个百分点。
该团队的代码可在GitHub上获取。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。