接地评估 vs. 非接地评估
为什么你的AI模型自我审查在视觉质量上失效
新研究引入“接地”作为控制测试时计算第三轴(交互缩放)的关键变量。研究结果表明,一种测量实际布局的确定性工具优于VLM截图评估,能修复视觉模态中40%到74%的缺陷,而标准指标却一无所见。

当AI模型生成网页、幻灯片或科学图表时,我们如何知道它看起来是否正确?该领域的默认答案是询问另一个模型, , 一个读取输出截图的视觉语言模型(VLM)。来自Pine AI和华盛顿大学的一篇新论文认为,这种方法不仅噪声大,而且在结构上存在盲点。
盲人法官
这篇名为《交互缩放:测试时计算的第三轴接地》的论文展示了一个令人震惊的演示。在对15个密集学术图表渲染的探测中,VLM截图法官将14个评为“完美”。当同样的制品通过确定性DOM几何测量工具(读取每个元素的真实边界框)进行测量时,只有三个是真正干净的。其余的有章节标题重叠打印、标签溢出框外、内容被裁剪出帧。
作者写道:“失败是机械性的。”截图以固定分辨率捕获;溢出画布的内容在图像到达法官之前就被裁剪出帧,而帧内的小重叠则低于其视觉敏锐度。
超越推理和采样
该论文的核心贡献是将交互重新定位为测试时计算的第三轴,与推理(更长的思维链)和采样(最佳N选)不同。关键变量是作者所称的接地:来自观察制品实际形式或行为的工具的反馈,而非来自模型对其发表意见的反馈。
作者解释道:“模型重新读取自己的输出无法学到任何它原本不知道的东西。”来自产生制品的相同权重的批评是后处理,没有增加关于正确答案的信息。接地反馈,如失败的测试回溯或测量的边界框,每个循环都会引入一个真实观察,打破他们所谓的“内部上限”。
在受控实验中,在相同的令牌预算下,仅推理和带预言验证器的最佳N选在硬编码任务上的通过率均停滞在87%以下。而每种交互策略则持续上升。提案者-审阅者组合达到了完美的100%通过率,且零种子方差。
覆盖范围是关键
该框架引入了一个覆盖原则:一个反馈通道的有效性取决于其工具观察范围的广度。这解释了为什么在同一代码集上,添加一个linter(接地但仅观察形式)相比于纯粹的批评没有任何收益,而执行反馈的收敛速度大约快2.5倍,且能达到更高的上限。
决定性的控制来自仅交换视觉模态中审阅者的工具。当VLM读取截图时,其编辑使几何更糟,增加了幻灯片上的缺陷,因为它对真实布局视而不见。而确定性几何审阅者(测量真实边界框)则显著减少了密集幻灯片(减少73%)和学术图表(减少74%)的缺陷。
作者指出:“一次审阅通过,结果相反,完全由信号是否覆盖缺陷决定。”
分布方差是一种预算
论文还包含一个关于训练的警示性发现。当作者通过监督微调将组合的交互质量蒸馏进一个80亿参数的学生模型时,该学生恢复了教师单样本能力的大约一半。但添加强化微调(提高了每轮一致性)实际上损害了pass@k性能。原因在于:输出分布中的方差正是采样转化为质量的资源。RFT消耗了该预算。
对领域的启示
作者认为,实际教训不是“添加更多循环”,而是“为所添加的循环接地”。对于视觉制品,这意味着在审阅者和评分器上都要测量渲染后的DOM,而非截图。这一发现对许多最近使用VLM法官来测量自改进视觉生成(而这些法官无法看到相关缺陷)的论文具有直接意义。
作者总结道:“交互缩放是真实的,不同于推理和采样,且可根据覆盖范围预测。一旦你接地了指标,它就清晰可见。”
代码和网站可在论文中的链接找到。
- 来源 : Interaction Scaling: Grounding the Third Axis of Test-Time Compute
- 来源 : Interaction Scaling code repository — 2026-06-20
- 来源 : Interaction Scaling project website — 2016-01-01
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。