多模态推理
2 published articles
人工智能3 min read
强化学习
Meta与UIUC研究者训练视觉语言模型自我核查并重新思考错误答案
SVR-R1将视觉语言模型自身的二元自我判定转化为学习信号。在图表和表格推理基准测试中,其表现大幅优于标准GRPO,同时模型逐渐需要更少的验证轮次,表明其将自我修正内化。
2026-07-25
大语言模型与模型4 min read
多模态AI
为什么视觉语言模型需要一个视觉中继窗来停止幻觉
新研究揭示了VLM中稳定三阶段多模态注意力再分配,并将其操作化为视觉中继窗(VRW)。TRACE框架使用轻量级训练模块按任务调度此窗口,在接地敏感基准测试中平均提高4.33个百分点,最高达6.6个百分点。
2026-07-23