强化学习
29 published articles
文档AI
为什么最好的文档解析器现在只需8亿参数
阿里巴巴的OvisOCR2,一个紧凑的0.8B端到端模型,在OmniDocBench(96.58)和PureDocBench(75.06)上取得了最先进的分数,超越了更大的基于流程的解析器。它的成功来自于一个数据引擎,混合了经过过滤的真实文档和合成页面,在4B教师模型上进行强化学习,并通过同策略蒸馏将知识注入小模型。
2026-07-24
AI编码智能体
阿里Qwen-Coder-Qoder在自家测试中击败Cursor,Token消耗降低14.5%
阿里新一代编码模型Qwen-Coder-Qoder在Qoder Bench基准测试中击败Cursor Composer-1。生产指标显示代码保留率提升3.85%,工具错误率下降61.5%,Token使用量减少14.5%。该模型通过奖励者-攻击者框架基于真实智能体轨迹进行训练,以防止奖励作弊。
2026-07-23
生物可信学习
用MNIST换CIFAR-10,类脑AI的方法完全反转
Sakana AI首次将无反向传播、符合戴尔原则的架构扩展到MNIST之外。关键在于:哪个技巧最重要在数据集之间完全反转, , 这对如何衡量生物可信AI是一个警告。
2026-07-22
AI 研究
图像生成的强化学习:Qwen-Image-2.0-RL 获得复合奖励系统
Qwen-Image-2.0-RL 报告详细描述了一条结合 RLHF、同策略蒸馏和复合奖励模型的后训练管道,用于提升文本到图像和图像编辑质量。该方法在审美质量、指令遵循和人脸身份保留方面均可衡量地改进。
2026-07-20
生物合理性AI
一个修复拯救了CIFAR-10,却对MNIST毫无帮助, , 这应让AI研究者警醒
Sakana AI的“误差扩散”将类脑、无反向传播学习扩展到CIFAR-10和强化学习。关键在于:哪些设计选择更重要在不同的基准测试间逆转,而戴尔原理的成本随任务难度增加。
2026-07-19
AI研究
强化学习自我破坏问题的两词解法
多任务强化学习有一个难以启齿的秘密:驱动对齐的奖励信号常常相互冲突。一个国际团队刚刚发表了一种方法,可以防止系统自我对抗,而且将其添加到现有管线中几乎不增加成本。
2026-07-19
具身智能
Mistral的80亿参数小模型让办公机器人不再依赖激光雷达
Mistral AI的Robostral Navigate是一个80亿参数的模型,仅使用一个RGB摄像头就在R2R-CE基准测试中达到76.6%的成功率,比多传感器方法高出4.5个百分点。它通过模拟数据和一种token高效的前缀缓存方法构建,能够跨机器人类型泛化并适应未见过的障碍物。
2026-07-17
AI研究
制约AI智能体的瓶颈不是探索,而是评估
Hugging Face的两篇新论文从相反的方向着手解决同一个核心问题:如何让AI智能体可靠地评估自身行为。AJ-Bench构建了一个针对环境感知型评判智能体的基准测试,而HeavySkill则认为最好的评判者存在于模型参数内部。
2026-07-17
人工智能
阿里巴巴开源世界模型:让AI智能体在模拟器中训练
阿里巴巴Qwen团队发布Qwen-AgentWorld,一种语言世界模型,能在七个领域模拟智能体环境。其CPT、SFT、RL三阶段流程构建出一个在保真度上击败GPT-5.4的模拟器,使智能体能够通过心理排练而非昂贵的真实环境展开进行训练。
2026-07-16
竞技编程
NousCoder-14B以开源RL流程挑战奥林匹克编程
Nous Research发布NousCoder-14B,一个基于Qwen3-14B通过RL构建的竞技编程模型。完整开源栈:权重、环境和评估套件。目标针对奥林匹克级别编码基准。
2026-07-16
人工智能
MiniMax M3 与打造防作弊推理模型的艺术
MiniMax 详解了 M3 推理能力背后的工程细节:一种深度防御验证器,成功避免了 M2 周期中的奖励破解失败模式;以及 MaxProof,一种群体级测试时扩展框架,将采样转化为引导式搜索。在 IMO 2025 和 USAMO 2026 上,使用 MaxProof 的 M3 超过了人类金牌得主阈值。
2026-07-16
强化学习工具链
Tinker-atropos 将强化学习实验与 Atropos 框架连接
Nous Research 发布了 tinker-atropos,这是 Tinker API 与 Atropos 强化学习框架之间的集成层。它将训练器、轨迹收集和环境服务解耦为可独立部署的组件,以实现更灵活的强化学习实验。
2026-07-16