编程竞赛
2 published articles
人工智能Featured3 min read
人工智能
能不断自我质疑的小模型,性能碾压10倍大的模型
RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。
2026-07-25
大语言模型与模型2 min read
竞技编程
NousCoder-14B以开源RL流程挑战奥林匹克编程
Nous Research发布NousCoder-14B,一个基于Qwen3-14B通过RL构建的竞技编程模型。完整开源栈:权重、环境和评估套件。目标针对奥林匹克级别编码基准。
2026-07-16