1 published article
AI研究
大规模审计显示,分布式RL智能体在从业者最可能信任的状态点上系统性地编造了风险权衡。在基于QR-DQN、C51和IQN的MinAtar环境中,最强断言无一可被证实,而依据智能体的CVaR建议行动有时表现显著低于随机水平。
2026-07-29