Fisher-R1 | 假设检验
AI智能体统计分析毫无差错,却仍得出错误结论
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。

LLM智能体正被用于科学领域最关键的职责之一:假设检验。它们检查数据集、生成代码,并端到端地完成分析。一篇于2026年8月7日发布在arXiv上的预印本论文警告说,这种自动化存在一个盲点。即使分析本身运行正确,智能体也经常得出错误的结论。这些错误是推断性的,而非机械性的:数据不支持的统计方法,或在数据假设下不成立的p值。大多数现有基准测试从未发现这些失败,因为它们评估的是输出,而非底层推断的有效性。
诊断很容易表述:当前的评估套件很少询问所报告的p值在数据假设下是否统计有效。这一差距至关重要,因为LLM智能体正被越来越多地用于自动化假设检验,而一次“干净”的运行可能看起来像可信的结果。这种模式与智能体研究其他领域的发现相呼应。早先关于编码智能体的工作记录了同样的反转:可靠地验证生成的解决方案变得比生成它更难。这篇新论文将这一教训带入了统计学领域。
基准测试遗漏的失败模式
为了衡量这一差距,研究团队构建了P-Bench,这是一个包含425个开放式假设检验任务的基准测试,涵盖经济学、生物学和医学。每个任务只向智能体提供一个科学假设和一个数据集。智能体必须选择统计方法、计算p值并得出结论。然后,评分方式做到了论文所称现有评估未做到的事:它检查所报告的p值在数据背后的假设下是否统计有效。
| P-Bench一览 | |
|---|---|
| 任务 | 425个开放式假设检验问题 |
| 领域 | 经济学、生物学、医学 |
| 提示格式 | 输入假设和数据集,输出方法、p值和结论 |
| 核心检查 | p值在数据假设下是否成立 |
强化学习带来了什么
提出的解决方案是Fisher-R1,一个开放权重的LLM智能体,经过合成任务和强化学习训练,专注于严格的假设检验。关键的设计选择在于奖励:统计验证,而非与参考答案一致。在P-Bench上,Fisher-R1-14B相比其骨干模型有显著提升,并超越了包括GPT-5.4和DeepSeek-V4-Pro在内的强专有和开源基线。最醒目的数字是,在单次试验成功率上比DeepSeek-V4-Pro平均相对提升21%,在最困难的任务上提升至26%。
| P-Bench上的报告结果 | Fisher-R1-14B |
|---|---|
| 与DeepSeek-V4-Pro相比 | 单次试验成功率平均相对提升21% |
| 与DeepSeek-V4-Pro相比,最难任务 | 相对提升最高达26% |
| 与GPT-5.4及其他强基线相比 | 据预印本,表现更优 |
作者对基线模型的评价直言不讳:“当前的LLM智能体缺乏假设检验所需的可靠统计推理。”简而言之,他们声称,在带有经过验证的统计奖励的任务上进行强化学习,能显著提高可靠性。
21%差距背后的警示
这一结果理应得到预印本常见的警示。它未经同行评审,而且P-Bench是作者自己的构建,因此基线是在其设计者创建的基准上被评判的,这是谨慎解读这些幅度的理由。单次试验成功率只是一个指标。允许智能体检查自身工作可能会缩小或扩大这一差距;这篇论文并未说明。
更难否认的是这一诊断,它落在一个已经在与评估可靠性搏斗的领域。2026年7月为统一智能体评估而创建的Messier语料库,统计了30个基准测试和714个智能体中的957,253条记录,并认为其中大部分实证记录无法比较。P-Bench是对同一问题的一个更聚焦的回应:一个为衡量特定失败模式而非又一个总体得分而构建的基准测试。
对于将假设检验交给智能体的团队来说,这堂实践课说起来容易,学起来代价高昂。一次干净的运行并不等于有效的推断,p值的可靠性完全取决于那些无人检查的假设。
- 来源 : AI agents run flawless statistics and still draw the wrong conclusions — 2026-08-07
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。