生物安全基准
AI智能体未能通过病原体监测测试:这值得我们警惕
BioSecBench-Surveillance 对16种AI智能体配置进行了100项基因组监测任务的测试。表现最佳的智能体准确率仅约50%。错误并非来自选择了错误的工作流程,而是来自围绕工作流程的其他选择, , 参考数据库、阈值、过滤器等, , 这些人类视为理所当然的细节。

病原体基因组监测曾有一个数据问题,或者更准确地说,它曾经困扰于这个问题:测序仪现在产生的原始读长数量远超受过训练的分析人员所能处理的范围。瓶颈已从数据生成转向了数据解读。AI智能体看起来是显而易见的解决方案,多家实验室已开始尝试使用它们。
2026年7月21日发布在arXiv上的一篇新论文,给这一思路的当前水平给出了一个确切的数字。答案是:大约50%。
该基准测试的独特之处
BioSecBench-Surveillance 由论文中列出的研究团队创建,包含100项评估,每项测试AI智能体能否从原始测序数据和监测背景中推导出正确的分析流程。智能体获得的信息与人类分析师所能获取的完全相同:测序读长、样本类型描述、所使用的测序平台。随后,系统以确定性方式对智能体的结构化答案进行评分,不涉及主观打分。
任务涵盖七个类别:分类学鉴定、抗菌药物耐药性分析、克隆相关性分析、重组检测、谱系或变异分型、血清型预测以及基因工程检测。样本涵盖了多种测序技术和样本类型,超出了标准的Illumina短读测序范围。

得分与数学依据
论文报告了来自16种模型-工具组合的3,962次可评分的尝试结果。研究者提供了置信区间,这一点至关重要,因为83项评估对于得出精确排名来说样本量较小。排名前三的模型及其置信区间如下。
Opus 4.8 with PI 达到了50.2%(95%置信区间:40.1%至60.3%)。GPT-5.5 with Codex 以50.2%的成绩并列(95%置信区间:40.8%至59.6%)。Opus 4.7 with PI 得分为49.6%(95%置信区间:40.0%至59.2%)。Sonnet 4.6 with PI 以48.6%的成绩紧随其后(95%置信区间:38.9%至58.3%)。鉴于置信区间重叠,这些差距均无统计学意义,因此核心结论是:最佳配置的表现集中在同一水平附近。
对于得分最高的模型对,超过一半的测试样本量来自抗菌药物耐药性分析任务,如果这些任务相对容易,则可能推高整体得分。原始研究并未按类别列出准确率,因此50.2%这个数字应被视为一个聚合值,其在各任务类型间的实际方差未知。
值得警惕的错误
更具启发性的发现并非准确率天花板,而是失败模式。论文报告,即使智能体调用了正确的工作流程,错误也源自围绕这些流程所做的选择。使用哪个参考数据库。匹配阈值设定在哪里。采用哪种标准化方法。保留或舍弃哪些过滤器。这些都是经验丰富的生物信息学家半自动做出的决策,而恰恰是这些决策,AI智能体以系统性的方式犯错了。
这种模式表明,仅靠更大的模型无法缩小差距。更大的参数量或更好的训练数据可能改善工作流程的选择,但围绕这些流程的判断性决策,显然无法从公开文本中学习到。它们依赖于在湿实验室和监测项目中积累的隐性知识。
下一次疫情爆发时的风险
论文作者将这一基准视为衡量智能体在下次疫情爆发时是否能被信任执行基因组监测的标准。目前50%的准确率显然意味着还不能信任。担忧之处不在于智能体会悄无声息地失败,而在于它会给出自信的错误答案,并在审查中蒙混过关,尤其是在分析师不堪重负的疫情爆发高峰期。
该基准测试本身是开放的,任务可验证,这意味着未来的工作可以衡量进展。这种进展是来自更好的智能体、更好的基准测试,还是更好的人类监督,是领域需要在下一场危机到来前回答的问题。
- 来源 : AI agents flunked a test on pathogen surveillance. That should worry us — 2026-07-21
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。