强化学习
26 published articles
开源
OpenForgeRL:无需改动推理框架即可训练AI智能体
OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。
2026-08-01
深度研究AI
BAAI的新研究智能体不只是搜索更长时间,它还会检查自己的作业
BAAI的AREX智能体使用递归自我改进循环,压缩长研究历史,实现高效的验证驱动型精炼。通过一种新颖的长视野强化学习方法进行训练,它们在BrowseComp、DeepSearchQA和HLE上优于可比基线。
2026-07-31
强化学习
微软体验式学习:给AI模型一个教练,而不仅仅是分数
体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。
2026-07-30
研究
可解释强化学习通过显著图助力空中交通管制
一个研究团队将可解释强化学习应用于空中交通管制,训练一个智能体避开禁飞区,并利用显著性图揭示其推理过程。这项工作是在高风险AI领域建立信任的初步步骤。
2026-07-27
研究
共享记忆是把双刃剑:将演员-评论家算法扩展到五个以上智能体时回报递减
研究人员在参数化动作任务中跨演员-评论家智能体共享回放缓冲区。GAC的性能大幅提升,但SAC和TQC仅有微小进步。超过五个智能体后,计算成本上升,却无实质性回报。该论文为共享经验方法的扩展极限提供了一个实用边界。
2026-07-27
脑机接口研究
强化学习将脑机接口解码精度提升41%
研究人员提出CNN-LSTM-RL,一种两阶段框架,应用强化学习纠正非侵入式脑机接口解码器中的系统误差。无需额外神经数据,该方法在十名参与者中将3D运动解码相关性提升41.5%,并将均方根误差降低40.2%。
2026-07-27
强化学习
Meta与UIUC研究者训练视觉语言模型自我核查并重新思考错误答案
SVR-R1将视觉语言模型自身的二元自我判定转化为学习信号。在图表和表格推理基准测试中,其表现大幅优于标准GRPO,同时模型逐渐需要更少的验证轮次,表明其将自我修正内化。
2026-07-25
人工智能
能不断自我质疑的小模型,性能碾压10倍大的模型
RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。
2026-07-25
研究
后见之明填补了智能体强化学习中的监督鸿沟
SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。
2026-07-25
文档AI
为什么最好的文档解析器现在只需8亿参数
阿里巴巴的OvisOCR2,一个紧凑的0.8B端到端模型,在OmniDocBench(96.58)和PureDocBench(75.06)上取得了最先进的分数,超越了更大的基于流程的解析器。它的成功来自于一个数据引擎,混合了经过过滤的真实文档和合成页面,在4B教师模型上进行强化学习,并通过同策略蒸馏将知识注入小模型。
2026-07-24
AI编码智能体
阿里Qwen-Coder-Qoder在自家测试中击败Cursor,Token消耗降低14.5%
阿里新一代编码模型Qwen-Coder-Qoder在Qoder Bench基准测试中击败Cursor Composer-1。生产指标显示代码保留率提升3.85%,工具错误率下降61.5%,Token使用量减少14.5%。该模型通过奖励者-攻击者框架基于真实智能体轨迹进行训练,以防止奖励作弊。
2026-07-23
生物可信学习
用MNIST换CIFAR-10,类脑AI的方法完全反转
Sakana AI首次将无反向传播、符合戴尔原则的架构扩展到MNIST之外。关键在于:哪个技巧最重要在数据集之间完全反转, , 这对如何衡量生物可信AI是一个警告。
2026-07-22