SevenTnewS

强化学习

26 published articles

开源2 min read

开源

OpenForgeRL:无需改动推理框架即可训练AI智能体

OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。

2026-08-01

AI代理3 min read

深度研究AI

BAAI的新研究智能体不只是搜索更长时间,它还会检查自己的作业

BAAI的AREX智能体使用递归自我改进循环,压缩长研究历史,实现高效的验证驱动型精炼。通过一种新颖的长视野强化学习方法进行训练,它们在BrowseComp、DeepSearchQA和HLE上优于可比基线。

2026-07-31

大语言模型与模型3 min read

强化学习

微软体验式学习:给AI模型一个教练,而不仅仅是分数

体验式学习将“大模型即评委”重新定位为“大模型即教练”,从每个响应中提取可迁移的知识,并通过在线策略上下文蒸馏将其内化,在保留任务上优于基于评分标准的强化学习,并减少了奖励欺骗。

2026-07-30

实验室与研究Featured1 min read

研究

可解释强化学习通过显著图助力空中交通管制

一个研究团队将可解释强化学习应用于空中交通管制,训练一个智能体避开禁飞区,并利用显著性图揭示其推理过程。这项工作是在高风险AI领域建立信任的初步步骤。

2026-07-27

NLP与机器学习3 min read

研究

共享记忆是把双刃剑:将演员-评论家算法扩展到五个以上智能体时回报递减

研究人员在参数化动作任务中跨演员-评论家智能体共享回放缓冲区。GAC的性能大幅提升,但SAC和TQC仅有微小进步。超过五个智能体后,计算成本上升,却无实质性回报。该论文为共享经验方法的扩展极限提供了一个实用边界。

2026-07-27

人工智能4 min read

脑机接口研究

强化学习将脑机接口解码精度提升41%

研究人员提出CNN-LSTM-RL,一种两阶段框架,应用强化学习纠正非侵入式脑机接口解码器中的系统误差。无需额外神经数据,该方法在十名参与者中将3D运动解码相关性提升41.5%,并将均方根误差降低40.2%。

2026-07-27

人工智能3 min read

强化学习

Meta与UIUC研究者训练视觉语言模型自我核查并重新思考错误答案

SVR-R1将视觉语言模型自身的二元自我判定转化为学习信号。在图表和表格推理基准测试中,其表现大幅优于标准GRPO,同时模型逐渐需要更少的验证轮次,表明其将自我修正内化。

2026-07-25

人工智能Featured3 min read

人工智能

能不断自我质疑的小模型,性能碾压10倍大的模型

RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。

2026-07-25

大语言模型与模型Featured5 min read

研究

后见之明填补了智能体强化学习中的监督鸿沟

SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。

2026-07-25

大语言模型与模型Featured4 min read

文档AI

为什么最好的文档解析器现在只需8亿参数

阿里巴巴的OvisOCR2,一个紧凑的0.8B端到端模型,在OmniDocBench(96.58)和PureDocBench(75.06)上取得了最先进的分数,超越了更大的基于流程的解析器。它的成功来自于一个数据引擎,混合了经过过滤的真实文档和合成页面,在4B教师模型上进行强化学习,并通过同策略蒸馏将知识注入小模型。

2026-07-24

Qwen / 阿里巴巴Featured4 min read

AI编码智能体

阿里Qwen-Coder-Qoder在自家测试中击败Cursor,Token消耗降低14.5%

阿里新一代编码模型Qwen-Coder-Qoder在Qoder Bench基准测试中击败Cursor Composer-1。生产指标显示代码保留率提升3.85%,工具错误率下降61.5%,Token使用量减少14.5%。该模型通过奖励者-攻击者框架基于真实智能体轨迹进行训练,以防止奖励作弊。

2026-07-23

Sakana AIFeatured1 min read

生物可信学习

用MNIST换CIFAR-10,类脑AI的方法完全反转

Sakana AI首次将无反向传播、符合戴尔原则的架构扩展到MNIST之外。关键在于:哪个技巧最重要在数据集之间完全反转, , 这对如何衡量生物可信AI是一个警告。

2026-07-22

← PreviousPage 1 / 3 · 26 articlesNext →