强化学习
29 published articles
Fisher-R1 | 假设检验
AI智能体统计分析毫无差错,却仍得出错误结论
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。
2026-08-19
研究
你使用工具的AI模型正在让简单问题变得更难
KlingTeam的一篇新论文衡量了多模态模型何时真正需要工具、何时工具反而造成损害。所提出的Beacon模型通过必要性感知奖励训练,在提高准确率的同时改善了工具使用纪律。
2026-08-09
可解释人工智能
无人愿意转动的旋钮:dtControl2+ε 让你牺牲最优性换取清晰度
dtControl2的一个新扩展允许工程师用精确数量的性能换取更小、更易理解的决策树。该工具dtControl2+ε保证ε-最优性,同时将树修剪至少几个数量级的节点。
2026-08-05
开源
OpenForgeRL:无需改动推理框架即可训练AI智能体
OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。
2026-08-01
深度研究AI
BAAI的新研究智能体不只是搜索更长时间,它还会检查自己的作业
BAAI的AREX智能体使用递归自我改进循环,压缩长研究历史,实现高效的验证驱动型精炼。通过一种新颖的长视野强化学习方法进行训练,它们在BrowseComp、DeepSearchQA和HLE上优于可比基线。
2026-07-31
强化学习
微软体验式学习:给AI模型一个教练,而不仅仅是分数
体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。
2026-07-30
研究
可解释强化学习通过显著图助力空中交通管制
一个研究团队将可解释强化学习应用于空中交通管制,训练一个智能体避开禁飞区,并利用显著性图揭示其推理过程。这项工作是在高风险AI领域建立信任的初步步骤。
2026-07-27
研究
共享记忆是把双刃剑:将演员-评论家算法扩展到五个以上智能体时回报递减
研究人员在参数化动作任务中跨演员-评论家智能体共享回放缓冲区。GAC的性能大幅提升,但SAC和TQC仅有微小进步。超过五个智能体后,计算成本上升,却无实质性回报。该论文为共享经验方法的扩展极限提供了一个实用边界。
2026-07-27
脑机接口研究
强化学习将脑机接口解码精度提升41%
研究人员提出CNN-LSTM-RL,一种两阶段框架,应用强化学习纠正非侵入式脑机接口解码器中的系统误差。无需额外神经数据,该方法在十名参与者中将3D运动解码相关性提升41.5%,并将均方根误差降低40.2%。
2026-07-27
强化学习
Meta与UIUC研究者训练视觉语言模型自我核查并重新思考错误答案
SVR-R1将视觉语言模型自身的二元自我判定转化为学习信号。在图表和表格推理基准测试中,其表现大幅优于标准GRPO,同时模型逐渐需要更少的验证轮次,表明其将自我修正内化。
2026-07-25
人工智能
能不断自我质疑的小模型,性能碾压10倍大的模型
RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。
2026-07-25
研究
后见之明填补了智能体强化学习中的监督鸿沟
SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。
2026-07-25