人工智能
能不断自我质疑的小模型,性能碾压10倍大的模型
RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。

一组研究人员在arXiv上发表了一篇论文,介绍了RefineRL,这是一种训练方法,它教小型语言模型在初始草稿通过可见测试后,仍能持续改进自己的代码。关键在于一个持怀疑态度的智能体,它拒绝相信自己的输出,并且即使在所有测试都显示通过时,仍持续寻找漏洞。
该方法将标准的Qwen3-4B基础模型与两项创新相结合。首先,是怀疑智能体(Skeptical-Agent),这是一个迭代循环,它在公开测试用例上运行模型的代码,然后拒绝将对测试用例的通过视为代码正确的证明。其次,是一个强化学习步骤,它训练模型实际使用这个循环,而不是像许多微调模型学会走捷径以获取更短奖励路径那样忽视它。
训练完成后,配备了怀疑智能体的紧凑型40亿参数模型在竞技编程基准测试中超越了320亿参数的模型。它们还接近了2350亿参数模型的单次尝试表现,后者包括了来自主要实验室的顶尖模型。该论文报告了在Qwen3-4B和Qwen3-4B-2507检查点上的性能提升。

这之所以重要,是因为竞技编程领域已成为大型语言模型推理能力的标准压力测试。单次尝试评估在文献中占主导地位。大多数论文测试的是模型能否一次性解决问题。RefineRL提出了一个不同的问题:模型能否学会利用它已有的时间?
怀疑机制是该方法与以往工作的不同之处。编码问题的标准强化学习会奖励通过测试的解决方案,然后停止。这教会模型产生勉强过关的初稿。怀疑智能体在通过后明确不会停止。它会主动搜索反例、边界情况或可能使解决方案在不同输入下失效的假设。论文将其描述为对自己的输出保持怀疑态度。
强化学习组件使用标准的RLVR数据,即问题与可验证答案的配对,而无需沿途手工设计的奖励信号或人工标注。这使得训练流程保持轻量化。研究人员认为这是一个实际优势:任何拥有编程问题数据集的实验室都可以复现该设置。
该结果与编码强化学习领域其他近期工作的发现相呼应。同样源自Qwen3-14B的NousCoder-14B,使用完全开放的强化学习流程达到了68%的Codeforces解题率。但RefineRL针对的是不同的成本规模。在40亿参数级别,它足够小,训练后可以在消费级硬件上运行,并且训练本身可能也在资金充足的学术团体的能力范围内。
该方法是否能推广到竞技编程之外,仍是一个开放性问题。竞技编程提供了清晰的反馈:一个解决方案要么通过隐藏测试,要么不通过。这个二元信号正是怀疑性自我改进所需要的。对于具有模糊或主观正确性标准的任务,同样的技术可能无法迁移。但论文表明,其原则, , 即由系统性地不信任自己的输出所驱动的迭代改进, , 可能比仅适用于编码更具普遍性。
这项工作也补充了越来越多的证据,表明模型规模本身并非通往更好推理能力的唯一途径。同策略技能提炼、基于结果的强化学习,以及现在的怀疑性改进方法都表明,训练方法有时比单纯扩大参数规模更能有效地缩小40亿参数模型与320亿参数模型之间的差距。规模定律是真实存在的,但它们可能忽略了一个变量:模型重新审视自己首次尝试的彻底程度。
RefineRL可在arXiv上获取,标识符为2604.00790。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。