SevenTnewS

强化学习

26 published articles

大语言模型与模型Featured5 min read

AI 研究

图像生成的强化学习:Qwen-Image-2.0-RL 获得复合奖励系统

Qwen-Image-2.0-RL 报告详细描述了一条结合 RLHF、同策略蒸馏和复合奖励模型的后训练管道,用于提升文本到图像和图像编辑质量。该方法在审美质量、指令遵循和人脸身份保留方面均可衡量地改进。

2026-07-20

Sakana AI7 min read

生物合理性AI

一个修复拯救了CIFAR-10,却对MNIST毫无帮助, , 这应让AI研究者警醒

Sakana AI的“误差扩散”将类脑、无反向传播学习扩展到CIFAR-10和强化学习。关键在于:哪些设计选择更重要在不同的基准测试间逆转,而戴尔原理的成本随任务难度增加。

2026-07-19

实验室与研究Featured4 min read

AI研究

强化学习自我破坏问题的两词解法

多任务强化学习有一个难以启齿的秘密:驱动对齐的奖励信号常常相互冲突。一个国际团队刚刚发表了一种方法,可以防止系统自我对抗,而且将其添加到现有管线中几乎不增加成本。

2026-07-19

大语言模型与模型Featured4 min read

具身智能

Mistral的80亿参数小模型让办公机器人不再依赖激光雷达

Mistral AI的Robostral Navigate是一个80亿参数的模型,仅使用一个RGB摄像头就在R2R-CE基准测试中达到76.6%的成功率,比多传感器方法高出4.5个百分点。它通过模拟数据和一种token高效的前缀缓存方法构建,能够跨机器人类型泛化并适应未见过的障碍物。

2026-07-17

人工智能Featured5 min read

AI研究

制约AI智能体的瓶颈不是探索,而是评估

Hugging Face的两篇新论文从相反的方向着手解决同一个核心问题:如何让AI智能体可靠地评估自身行为。AJ-Bench构建了一个针对环境感知型评判智能体的基准测试,而HeavySkill则认为最好的评判者存在于模型参数内部。

2026-07-17

大语言模型与模型4 min read

人工智能

阿里巴巴开源世界模型:让AI智能体在模拟器中训练

阿里巴巴Qwen团队发布Qwen-AgentWorld,一种语言世界模型,能在七个领域模拟智能体环境。其CPT、SFT、RL三阶段流程构建出一个在保真度上击败GPT-5.4的模拟器,使智能体能够通过心理排练而非昂贵的真实环境展开进行训练。

2026-07-16

工具与框架Featured2 min read

强化学习工具链

Tinker-atropos 将强化学习实验与 Atropos 框架连接

Nous Research 发布了 tinker-atropos,这是 Tinker API 与 Atropos 强化学习框架之间的集成层。它将训练器、轨迹收集和环境服务解耦为可独立部署的组件,以实现更灵活的强化学习实验。

2026-07-16

大语言模型与模型2 min read

竞技编程

NousCoder-14B以开源RL流程挑战奥林匹克编程

Nous Research发布NousCoder-14B,一个基于Qwen3-14B通过RL构建的竞技编程模型。完整开源栈:权重、环境和评估套件。目标针对奥林匹克级别编码基准。

2026-07-16

人工智能Featured5 min read

人工智能

MiniMax M3 与打造防作弊推理模型的艺术

MiniMax 详解了 M3 推理能力背后的工程细节:一种深度防御验证器,成功避免了 M2 周期中的奖励破解失败模式;以及 MaxProof,一种群体级测试时扩展框架,将采样转化为引导式搜索。在 IMO 2025 和 USAMO 2026 上,使用 MaxProof 的 M3 超过了人类金牌得主阈值。

2026-07-16

AI代理3 min read

AI 智能体

OpenManus 终结了 AI 智能体的邀请码门槛:十分钟内即可运行

OpenManus 是一个开源的 AI 智能体框架,任何人都可以立即安装和运行:无需邀请码,无需花招,只需一个 Python 环境和 API 密钥。这就是为什么你需要它。

2026-07-11

NLP与机器学习Featured4 min read

AI研究

为何GPT-5.5在测试智能体自我改进能力的基准测试中占据主导

EvoPolicyGym 隔离了一个关键但研究不足的能力:智能体通过反复受限反馈编辑来完善可执行策略的能力。该基准测试显示 GPT-5.5 在 16 个环境中表现最强,并提供了轨迹级诊断,揭示了不同智能体如何分配预算以及如何将反馈转化为调优参数。

2026-07-11

xAI / GrokFeatured3 min read

Grok 4.5

Cursor的Grok 4.5由AI智能体而非人类构建, , 这才是真正的新闻。

Cursor的Grok 4.5是一个混合专家模型,使用由早期AI智能体(而非人类)创造的环境中的强化学习进行训练。它能处理软件工程、数据科学、金融和法律等领域复杂且耗时长久的任务,现已可用。

2026-07-10

← PreviousPage 2 / 3 · 26 articlesNext →