AI推理
2 published articles
人工智能Featured3 min read
人工智能
能不断自我质疑的小模型,性能碾压10倍大的模型
RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。
2026-07-25
人工智能6 min read
AI研究
MaxProof:如何将生成式验证器转化为证明革命引擎
MaxProof是一个测试时扩展框架,将数学证明生成建模为进化搜索过程。通过结合Proof RL、验证器对齐和修正增强,它把不可靠的生成式验证转化为用于训练和推理的可信奖励系统。
2026-07-05