SevenTnewS

人工智能

能不断自我质疑的小模型,性能碾压10倍大的模型

RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 3 分钟

能不断自我质疑的小模型,性能碾压10倍大的模型
来源 : RefineRL: Advan…

一组研究人员在arXiv上发表了一篇论文,介绍了RefineRL,这是一种训练方法,它教小型语言模型在初始草稿通过可见测试后,仍能持续改进自己的代码。关键在于一个持怀疑态度的智能体,它拒绝相信自己的输出,并且即使在所有测试都显示通过时,仍持续寻找漏洞。

该方法将标准的Qwen3-4B基础模型与两项创新相结合。首先,是怀疑智能体(Skeptical-Agent),这是一个迭代循环,它在公开测试用例上运行模型的代码,然后拒绝将对测试用例的通过视为代码正确的证明。其次,是一个强化学习步骤,它训练模型实际使用这个循环,而不是像许多微调模型学会走捷径以获取更短奖励路径那样忽视它。

训练完成后,配备了怀疑智能体的紧凑型40亿参数模型在竞技编程基准测试中超越了320亿参数的模型。它们还接近了2350亿参数模型的单次尝试表现,后者包括了来自主要实验室的顶尖模型。该论文报告了在Qwen3-4B和Qwen3-4B-2507检查点上的性能提升。

示意图:RefineRL训练:怀疑智能体循环和强化学习步骤
RefineRL通过一个持怀疑态度的迭代循环来训练一个小模型,该循环在测试通过后主动寻找错误,然后使用强化学习来强化使用该循环的行为,如文中所述。

这之所以重要,是因为竞技编程领域已成为大型语言模型推理能力的标准压力测试。单次尝试评估在文献中占主导地位。大多数论文测试的是模型能否一次性解决问题。RefineRL提出了一个不同的问题:模型能否学会利用它已有的时间?

怀疑机制是该方法与以往工作的不同之处。编码问题的标准强化学习会奖励通过测试的解决方案,然后停止。这教会模型产生勉强过关的初稿。怀疑智能体在通过后明确不会停止。它会主动搜索反例、边界情况或可能使解决方案在不同输入下失效的假设。论文将其描述为对自己的输出保持怀疑态度。

强化学习组件使用标准的RLVR数据,即问题与可验证答案的配对,而无需沿途手工设计的奖励信号或人工标注。这使得训练流程保持轻量化。研究人员认为这是一个实际优势:任何拥有编程问题数据集的实验室都可以复现该设置。

该结果与编码强化学习领域其他近期工作的发现相呼应。同样源自Qwen3-14B的NousCoder-14B,使用完全开放的强化学习流程达到了68%的Codeforces解题率。但RefineRL针对的是不同的成本规模。在40亿参数级别,它足够小,训练后可以在消费级硬件上运行,并且训练本身可能也在资金充足的学术团体的能力范围内。

该方法是否能推广到竞技编程之外,仍是一个开放性问题。竞技编程提供了清晰的反馈:一个解决方案要么通过隐藏测试,要么不通过。这个二元信号正是怀疑性自我改进所需要的。对于具有模糊或主观正确性标准的任务,同样的技术可能无法迁移。但论文表明,其原则, , 即由系统性地不信任自己的输出所驱动的迭代改进, , 可能比仅适用于编码更具普遍性。

这项工作也补充了越来越多的证据,表明模型规模本身并非通往更好推理能力的唯一途径。同策略技能提炼、基于结果的强化学习,以及现在的怀疑性改进方法都表明,训练方法有时比单纯扩大参数规模更能有效地缩小40亿参数模型与320亿参数模型之间的差距。规模定律是真实存在的,但它们可能忽略了一个变量:模型重新审视自己首次尝试的彻底程度。

RefineRL可在arXiv上获取,标识符为2604.00790。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。