1 published article
Fisher-R1 | 假设检验
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。
2026-08-19