SevenTnewS

强化学习

Meta与UIUC研究者训练视觉语言模型自我核查并重新思考错误答案

SVR-R1将视觉语言模型自身的二元自我判定转化为学习信号。在图表和表格推理基准测试中,其表现大幅优于标准GRPO,同时模型逐渐需要更少的验证轮次,表明其将自我修正内化。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 4 分钟

Meta与UIUC研究者训练视觉语言模型自我核查并重新思考错误答案
来源 : SVR-R1: Bootstr…

人类如果有机会再思考一次,通常能推理出更好的答案。Meta与伊利诺伊大学厄巴纳-香槟分校的一篇新论文表明,视觉语言模型(VLM)可以通过检查自己的输出并在判定答案错误时重新思考,学会同样的事情,整个过程在一个无需外部评判或辅助批评者的强化学习循环内完成。

该框架名为自验证推理器(SVR-R1),采用基于GRPO的多轮RL训练方案。对于每个查询,模型生成一个答案,同时发出一个二元自我判定(是或否)。"否"会触发第二次机会重新思考;"是"(或达到轮次上限)则最终确定输出,随后获得基于结果的奖励。相同模型权重同时充当生成器和验证器,验证令牌被从损失计算中屏蔽,以避免冲突的优化信号。

结果不言自明

在ChartQA测试集(826个测试问答对)和TableVQA测试集(1250个基于表格的问题)上评估时,SVR-R1在3B和7B参数规模下均持续优于标准GRPO基线。在ChartQA上,3B规模的SVR-R1在纯运行模式(推理时不进行验证)下达到83.3%的准确率,而GRPO基线为80.5%。在推理时启用最终验证后,SVR-R1达到相同的83.3%,基线达到80.9%。在TableVQA上,3B规模的SVR-R1达到72.4%(纯运行)和72.9%(带验证),而GRPO分别为68.3%和68.7%。

类似优势在7B规模上同样存在。在ChartQA上,SVR-R1达到82.9%(纯运行和带验证),而GRPO为80.4%和81.1%。在TableVQA上,SVR-R1得分为80.3%和80.6%,而GRPO为78.7%和78.5%。在通用推理基准测试ThinkLite-VL-70K上,SVR-R1在MathVista(71.6% vs 70.8%)、MathVision(19.1% vs 17.4%)和MMStar(49.3% vs 48.7%)上优于最佳GRPO基线,而在AI2D上与之持平(81.4% vs 81.5%)。

更少的验证轮次,更高的置信度

训练过程中最有趣的动态是平均验证轮次的稳步下降。随着模型训练,其对初始答案变得更加自信,倾向于立即确认,最终稳定在大约一个生成步骤后验证器输出一次"是"。到训练后期,SVR-R1在纯运行和最终验证设置下达到几乎相同的准确率,这表明模型已将自我修正内化,能够生成它认为自己正确的答案,而无需在推理时实际执行重新思考。

作者将部分增益归因于框架通过多轮展开将中等难度问题的高质量答案最终确定的能力。对太难的问题反复重新思考贡献不大,因为即使有无限次验证轮次,正确答案也可能无法达到。

实际意义与开放问题

SVR-R1桥接了VLM推理时自我优化与RL训练之间较少被探索的交集。通过仅依赖二元自我验证(是/否),该方法避免了需要详细解释或外部真实标签,使其具有可扩展性和数据效率。研究人员计划将SVR-R1开源,以支持多模态推理的进一步研究。

该论文还提出了如何联合优化验证和生成能力的问题,特别是随着VLM自我验证能力的提升。目前,SVR-R1提供了一种简单的配方,用于引导多模态推理,所需一切只是模型自身对其初步尝试说"是"或"否"的能力。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。