SevenTnewSAI 与科技新闻,深度解读

强化学习

29 published articles

大语言模型与模型Featured4 min read

文档AI

为什么最好的文档解析器现在只需8亿参数

阿里巴巴的OvisOCR2,一个紧凑的0.8B端到端模型,在OmniDocBench(96.58)和PureDocBench(75.06)上取得了最先进的分数,超越了更大的基于流程的解析器。它的成功来自于一个数据引擎,混合了经过过滤的真实文档和合成页面,在4B教师模型上进行强化学习,并通过同策略蒸馏将知识注入小模型。

2026-07-24

Qwen / 阿里巴巴Featured4 min read

AI编码智能体

阿里Qwen-Coder-Qoder在自家测试中击败Cursor,Token消耗降低14.5%

阿里新一代编码模型Qwen-Coder-Qoder在Qoder Bench基准测试中击败Cursor Composer-1。生产指标显示代码保留率提升3.85%,工具错误率下降61.5%,Token使用量减少14.5%。该模型通过奖励者-攻击者框架基于真实智能体轨迹进行训练,以防止奖励作弊。

2026-07-23

Sakana AIFeatured1 min read

生物可信学习

用MNIST换CIFAR-10,类脑AI的方法完全反转

Sakana AI首次将无反向传播、符合戴尔原则的架构扩展到MNIST之外。关键在于:哪个技巧最重要在数据集之间完全反转, , 这对如何衡量生物可信AI是一个警告。

2026-07-22

大语言模型与模型Featured5 min read

AI 研究

图像生成的强化学习:Qwen-Image-2.0-RL 获得复合奖励系统

Qwen-Image-2.0-RL 报告详细描述了一条结合 RLHF、同策略蒸馏和复合奖励模型的后训练管道,用于提升文本到图像和图像编辑质量。该方法在审美质量、指令遵循和人脸身份保留方面均可衡量地改进。

2026-07-20

Sakana AI7 min read

生物合理性AI

一个修复拯救了CIFAR-10,却对MNIST毫无帮助, , 这应让AI研究者警醒

Sakana AI的“误差扩散”将类脑、无反向传播学习扩展到CIFAR-10和强化学习。关键在于:哪些设计选择更重要在不同的基准测试间逆转,而戴尔原理的成本随任务难度增加。

2026-07-19

实验室与研究Featured4 min read

AI研究

强化学习自我破坏问题的两词解法

多任务强化学习有一个难以启齿的秘密:驱动对齐的奖励信号常常相互冲突。一个国际团队刚刚发表了一种方法,可以防止系统自我对抗,而且将其添加到现有管线中几乎不增加成本。

2026-07-19

大语言模型与模型Featured4 min read

具身智能

Mistral的80亿参数小模型让办公机器人不再依赖激光雷达

Mistral AI的Robostral Navigate是一个80亿参数的模型,仅使用一个RGB摄像头就在R2R-CE基准测试中达到76.6%的成功率,比多传感器方法高出4.5个百分点。它通过模拟数据和一种token高效的前缀缓存方法构建,能够跨机器人类型泛化并适应未见过的障碍物。

2026-07-17

人工智能Featured5 min read

AI研究

制约AI智能体的瓶颈不是探索,而是评估

Hugging Face的两篇新论文从相反的方向着手解决同一个核心问题:如何让AI智能体可靠地评估自身行为。AJ-Bench构建了一个针对环境感知型评判智能体的基准测试,而HeavySkill则认为最好的评判者存在于模型参数内部。

2026-07-17

大语言模型与模型4 min read

人工智能

阿里巴巴开源世界模型:让AI智能体在模拟器中训练

阿里巴巴Qwen团队发布Qwen-AgentWorld,一种语言世界模型,能在七个领域模拟智能体环境。其CPT、SFT、RL三阶段流程构建出一个在保真度上击败GPT-5.4的模拟器,使智能体能够通过心理排练而非昂贵的真实环境展开进行训练。

2026-07-16

大语言模型与模型2 min read

竞技编程

NousCoder-14B以开源RL流程挑战奥林匹克编程

Nous Research发布NousCoder-14B,一个基于Qwen3-14B通过RL构建的竞技编程模型。完整开源栈:权重、环境和评估套件。目标针对奥林匹克级别编码基准。

2026-07-16

人工智能Featured5 min read

人工智能

MiniMax M3 与打造防作弊推理模型的艺术

MiniMax 详解了 M3 推理能力背后的工程细节:一种深度防御验证器,成功避免了 M2 周期中的奖励破解失败模式;以及 MaxProof,一种群体级测试时扩展框架,将采样转化为引导式搜索。在 IMO 2025 和 USAMO 2026 上,使用 MaxProof 的 M3 超过了人类金牌得主阈值。

2026-07-16

工具与框架Featured2 min read

强化学习工具链

Tinker-atropos 将强化学习实验与 Atropos 框架连接

Nous Research 发布了 tinker-atropos,这是 Tinker API 与 Atropos 强化学习框架之间的集成层。它将训练器、轨迹收集和环境服务解耦为可独立部署的组件,以实现更灵活的强化学习实验。

2026-07-16

← PreviousPage 2 / 3 · 29 articlesNext →