SevenTnewS

科学文献搜索

化学家搜索论文;AskChem 用 240 万条论断作答

AskChem 索引了来自 147,000 篇论文的 240 万条化学论断,每条均以来源 DOI 和逐字引文为依据,通过网络应用、REST、SDK 和 MCP 提供给科学家和 AI 智能体。在 AskChem-Bench 上,GPT-5.5 阅读器的 DOI 可解析率从 88.3% 提升到 100%。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 最后更新:2026-08-02 · 阅读需 4 分钟

化学家搜索论文;AskChem 用 240 万条论断作答

文献检索引擎返回文档。AskChem 返回论断,每条论断都附有其证据。这正是纽约大学这项新研究基础设施背后的全部赌注,它所针对的问题被作者直白地描述为:从文献中提取特定发现意味着要从多篇论文中收集结果,核对每个数字的来源,然后手工拼装答案。

这篇论文于 2026 年 7 月底发布在 arXiv 上,主张问题在于检索的单位。按排名排列的论文列表回答的是“这个话题上存在什么”。AskChem 是为一个更难的问题而构建的:“文献实际上说了什么?”

检索的单位是论断,而非论文

AskChem 将每篇被索引的论文转换为原子化、带类型的论断。每条论断都以来源 DOI 和论文中的逐字引文或明确的证据定位器为依据。因此,搜索结果不是指向 PDF 的链接,而是一条附有凭证的陈述。该数据库目前包含从 147,000 篇论文中提取的 240 万条论断。

溯源本身就是产品,而不是事后附加的功能。当化学家在使用某条发现前必须进行核实时,一条带有来源和准确措辞的论断,省下了搜索引擎从未自动化的那部分文献工作。

进入同一论断库的三种方式

AskChem 并没有在该数据库上提供一个简单的搜索框。它提供了三种互补的结构。一个稳定的分面分类法支持层级检索和浏览,用户可以按类别缩小范围,同时不丢失底层的论断。一个证据图通过关系将论断相互连接,使跨论文的综合分析以图的形式呈现,而不是一堆文档。一个探索性的动态分类法将已索引的论文置于科学原理之下,这是一种按照化学家对该领域的思考方式而非出版商的组织方式来浏览语料库的途径。

围绕可追溯性构建的基准

评估基准 AskChem-Bench 衡量的是大多数搜索基准都会跳过的一项指标:检索到的材料能否追溯到其来源。基于 AskChem 的 GPT-5.5 阅读器解析了其 100% 的 DOI,而无检索时为 88.3%,并且在五个测试系统中产生了最高的引文密度。

AskChem-Bench 指标使用 AskChem 的 GPT-5.5无检索的 GPT-5.5
可解析 DOI100%88.3%
引文密度五个测试系统中最高论文中未报告

这些数字来自作者自己的基准,这一点值得直接说明。差距仍然是关键。一个能够引用每个来源的阅读器,比一个返回略好文档排名的阅读器对综合工作更有用,而 11.7 个百分点的提升正是该项目用一个数字表达的核心论点。

为智能体而生,而不仅仅为人类

Web 界面是该项目的可见部分。在底层,论断库通过 REST、SDK 和模型上下文协议(MCP)开放访问。这个细节比看起来更重要。需要引用来源的研究智能体现在可以查询一个索引,该索引的设计使溯源成为每个结果的属性,而不是手工清理步骤。科学家仍然需要判断论断是否正确;AskChem 只是消除了论断来源不明的那一部分。MCP 路径值得关注:智能体可以将 AskChem 视为直接调用的工具,而不是必须抓取的网站。

论文未声称的内容

AskChem-Bench 是一个开始,而不是最终定论。论文没有报告提取错误率,147,000 篇论文也只是化学文献的一部分,而非全部。随着语料库的增长,论断提取能否保持准确仍是一个悬而未决的问题。其赌注是,一个自带证据的论断库在综合工作方面比排名文档更具可扩展性。值得关注的数字是,那 100% 的可追溯性能否在更广泛、更庞杂的语料库上经受住独立测试。

AskChem 已在 askchem.org 上线。化学家是否会采用它,将归结于一个平淡的问题:论断在核验时有多经常站得住脚。基础设施是容易的部分;文献并不总是整洁的。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。