SevenTnewS

基准测试

大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理

SDABench是一个全新的能力导向型基准,涵盖六项核心科学推理技能和五个领域,测试了15个大语言模型,发现模型在描述性分析上表现强劲,但在推理性和因果任务中崩溃。该论文提供了一个五阶段错误分析框架来定位失败原因。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-25 · 阅读需 4 分钟

大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理
来源 : arXiv:2607.1107…

大型语言模型因其编写代码、总结文献甚至生成看似合理的科学工作流的能力而备受赞誉。但一篇于2026年7月13日发布在arXiv上的新论文认为,科学发现的标准要高得多,而且当前的基准一直在衡量错误的东西。

由Chuhan Shi和Xiaoquan Ren领导的研究人员引入的SDABench,围绕六种不同能力重新组织评估:描述性、探索性、推理性、预测性、因果性和机制性。该基准不是奖励模型拼凑出一个以正确数字结束的工作流,而是测试模型是否理解哪种分析方法适合问题,是否能够对未观测变量进行建模,以及是否能够推理因果关系,而不仅仅是相关性。

该基准包含527个真实数据实例(SDA-Real)和6000个合成实例(SDA-Synth),每个实例都有多项选择和开放式两种格式,通过自动化流水线构建。领域涵盖生物学、化学、环境学、地理学和物理学。

描述性能力、推理能力崩溃

当研究人员评估15个代表性大语言模型时,模式非常明显。模型在处理描述性分析时表现稳健,例如总结均值、方差和分布等任务。但一旦任务需要选择假设、建模潜在过程或进行机制性推理,性能就会急剧下降。

“模型在处理描述性分析时表现良好,但在需要假设选择、潜在过程建模或机制性推理的任务中性能急剧下降,”作者写道。这表明大语言模型目前更适合作为数据助手,而不是自主科学家。

五阶段错误分析框架

SDABench最有用的贡献之一可能是其五阶段错误分析框架,该框架精确指出了大语言模型的失败点。这些阶段包括:范围识别、变量识别、程序选择、关系建模和结论得出。

研究结果具有细微差别。更先进的模型,例如来自OpenAI、Google DeepMind和Anthropic的最新变体,能够可靠地识别科学问题的相关范围和变量。但它们仍然难以选择合适的分析程序、对变量之间的关系进行建模,并得出与所选方法假设相一致的有效结论。

这不是一个简单的规模扩展故事:向模型投入更多参数并不能解决模式匹配与科学推理之间的根本差距。

基准测试揭示了人工智能科学的什么

这项研究对正在发展的“人工智能科学家”领域具有直接影响,这些声称能够端到端进行文献综述、假设生成、实验和论文写作的自动化系统。Shi和Ren的研究表明,这些系统可能会产生看似令人信服的输出,同时犯下人类审稿人会发现的根本性逻辑错误。

SDABench还揭示了一个更深层次的问题:混淆了“能够生成输出”与“理解适当的方法”。一个可以编写Python代码来运行t检验的模型并不一定理解t检验假设正态性和独立性,也无法根据数据特征在t检验和Mann-Whitney U检验之间做出选择。

超越相关性进入因果关系

论文对因果和机制性推理的关注尤其及时。过去一年,人工智能社区对因果推断的兴趣激增,但大多数基准并未明确测试模型区分相关性和因果关系的能力。SDABench做到了,结果表明,这仍然是一个即使是前沿模型也未能征服的前沿能力。

机制性推理,即理解生成数据的底层过程,更具挑战性。没有一个被评估的模型在这个维度上表现出色。

对人工智能在科学领域未来的影响

SDABench并未认为大语言模型对科学无用。相反,它提供了一个精细的诊断工具,可以指导开发。设计更好的科学大语言模型的研究人员现在可以针对特定的错误类型,例如程序选择或关系建模,并追踪改进。

该论文还为人工智能安全和对齐社区提出了一个关键问题:如果一个智能体无法可靠地选择正确的统计检验或推理因果关系,是否应该允许它自主设计实验或从数据中得出结论?该基准为解决这个问题提供了一个具体的试验田。

随着人工智能驱动的科学发现领域日渐成熟,SDABench提供了一个严格的、多维度的进展衡量标准,并清醒地提醒我们:描述数据集不等于理解它。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。