研究
共享记忆是把双刃剑:将演员-评论家算法扩展到五个以上智能体时回报递减
研究人员在参数化动作任务中跨演员-评论家智能体共享回放缓冲区。GAC的性能大幅提升,但SAC和TQC仅有微小进步。超过五个智能体后,计算成本上升,却无实质性回报。该论文为共享经验方法的扩展极限提供了一个实用边界。

2026年7月21日发布在arXiv上的一篇论文探讨了强化学习研究中的一个空白:当为单智能体参数化动作任务设计的演员-评论家算法被投入到多智能体环境中,且没有通常的集中式训练框架时,会发生什么?
作者Clement Nyirenda将三种成熟的单智能体算法, , 贪婪演员-评论家(GAC)、软演员-评论家(SAC)和截断分位数评论家(TQC), , 扩展为共享经验的多智能体版本:MAGAC、MASAC和MATQC。与多智能体强化学习中占主导地位的集中式训练、分散式执行(CTDE)范式不同,每个智能体保留自己的策略网络和价值网络,但共同使用一个共享回放缓冲区。
这一想法很务实:让智能体在共享经验的同时独立学习,减少CTDE通常所需的协调开销。然而,不同算法的结果差异很大。
GAC大幅提升,SAC和TQC停滞

在Platform-v0和Goal-v0基准测试中,MAGAC始终优于其单智能体版本。在三智能体、五智能体和十智能体配置中,差异具有统计学显著性,并通过单因素方差分析和Tukey HSD事后检验证实。对于GAC而言,共享回放缓冲区是一个明显的优势。
MASAC和MATQC的提升较为温和。它们的多智能体版本在平均评估回报上确实超过了单智能体基线,但差距很小,论文将其描述为相对有限。共享回放缓冲区给SAC和TQC留下的利用空间较小,可能是因为这两种算法已经包含了内置的探索和稳定机制,留给多智能体架构的可提升空间较少。
五智能体壁垒
该研究对每种算法分别使用三个、五个和十个智能体进行了测试。结果保持一致:从三个增加到五个智能体带来了可衡量的收益;而从五个增加到十个则没有。额外的智能体几乎没有提升评估回报,但训练时间却显著增加,尤其是MAGAC,其计算成本扩展性最差。
这一结果对任何在有限GPU预算下设计实际多智能体系统的人都很重要。论文并未声称存在一个通用阈值,但数据表明,超过五个智能体后,共享经验的演员-评论家架构将计算资源用于冗余而非学习。性能与效率之间的权衡十分明显。
Nyirenda指出,所使用的基准测试Platform-v0和Goal-v0是离散参数化动作环境。它们要求智能体同时选择动作类型和连续参数,更接近机器人控制任务,而非棋盘游戏或Atari风格的强化学习。扩展性天花板在不同环境中可能发生变化,但论文提出了一个明确的经验主张:对于这类任务,五个智能体是一个实际的上限。
共享经验何处有效,何处无效
架构选择值得深入探讨。论文刻意避开了CTDE,后者需要一个能观察所有智能体动作的集中式评论家。相反,每个智能体的评论家基于自身观察和动作进行工作,回放缓冲区是唯一的共享资源。这简化了训练,但也意味着智能体无法通过联合价值函数进行隐式协调。结果表明,对于某些算法(SAC、TQC),这种协调的损失超过了共享经验带来的好处;而对于GAC,共享效果占主导地位。
一张总结不同配置对比结果的表格本可以更清晰地展示模式,但论文本身基于每种配置十次独立运行的图表显示了直接的方差,并通过统计检验直接处理。关键结论是,一旦超过最低阈值,算法选择比智能体数量更重要。
对于在机器人技术、仿真或连续控制领域构建多智能体强化学习系统的研究人员来说,实际含义很直接:从三个智能体开始,测试五个,并且不要假设十个会带来帮助。额外计算资源最好用于调优单智能体骨干网络。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。