临床AI
nMAS自动化心力衰竭EHR特征工程,但仅在500名模拟患者上测试
nMAS是一个多智能体流水线,从500份模拟患者记录中生成132个结构化特征和70个按评分标准评分的特征,将留出验证的HFrEF表型识别AUROC从0.895提升至0.963。该预印本尚未在真实患者数据上得到验证。

在任何模型接受心力衰竭研究训练之前,必须有人将原始电子健康记录转化为模型可学习的特征:用药史、实验室检查轨迹,以及那些真正承载临床信号的小片段。预印本报告称,这项工作占用了数据科学家在EHR项目上39%至45%的时间。对于估计影响670万美国成年人的心力衰竭来说,情况更糟,因为证据分散在零散的记录中,必须结合针对特定疾病、基于指南的临床推理进行整合。
该论文于8月6日发布在arXiv上,认为基于规则的系统与基于LLM的方法只能实现部分自动化,可维护性有限,且对每个特征来源的追踪能力较弱。其答案是Nimblemind多智能体系统nMAS,一种证据关联的流水线,将每个特征锚定在源数据中,并在运行过程中依据评分标准对自己的输出打分。
在来自9个EHR源数据表的500份模拟患者记录上,nMAS生成了132个结构化特征和70个按评分标准评分的聚合特征,并在此过程中检查了结构完整性、来源与评分标准符合性。一个受限LLM对输出进行了审计,一个独立的基于LLM的评分标准评估(针对证据支持与方法学稳健性)使这些特征获得了最高分81.5%的得分。
AUROC提升实际说明了什么
核心结果是表型识别能力的提升。将nMAS的聚合特征加入留出评估后,HFrEF(射血分数降低的心力衰竭)的AUROC从0.895升至0.963,HFpEF(射血分数保留的心力衰竭)的AUROC从0.870升至0.910。这一区分很重要,因为两种类型的治疗方式不同。
| 表型 | 基线AUROC | 加入nMAS特征后 |
|---|---|---|
| HFrEF | 0.895 | 0.963 |
| HFpEF | 0.870 | 0.910 |
这些是在留出集上有意义的提升。问题在于,整个评估都是在模拟记录上进行的。这里没有真实患者数据,没有多中心队列,论文也指出仍需要外部验证。一个在模拟数据上表现良好的流水线,只能证明它能遵循自己的规则,并不能证明它能经受住真实医院的混乱情况。
摘要中未报告与人工构建特征的对比。因此,工作量论证依赖于一个假设:自动化特征是否足够好到能够替代人工努力,而不仅仅是补充。
可审计性才是重点,而不是AUROC
更深层的诉求是可追溯性。大多数自动化特征工程是一个黑箱:下游模型无法解释特征,特征也没有历史记录。nMAS的设计使每个特征都可以追溯到源数据表中的证据,带有评分标准得分,并已经过受限LLM审计员的检查。对于临床工作而言,这种追踪轨迹决定了模型是“监管者可以检查”还是“没人能批准”。
nMAS出现在一批朝同一方向推进的拥挤的临床AI预印本中。7月下旬发布的ClinPRISM,将一个高性价比的多模态LLM推理框架应用于不规则临床时间序列上的问答,也就是EHR数据给语言模型带来的稀疏性与异步性问题。同样来自7月的BioSecBench-Surveillance,是一个包含100项评估的可验证基准,测试AI智能体能否从原始测序数据和监测情境中推断出正确的分析流水线。贯穿这些工作的主线是验证,而不是原始准确率。
真正部署前还缺少什么
论文对差距直言不讳。评估止步于单一机构的模拟队列。下一步显然是来自多个机构的真实患者记录,以及可供外部人员检查而非仅凭作者说法的审计轨迹。
81.5%的评分标准得分既是巧妙之处,也是脆弱之处。一个独立的LLM根据证据支持与方法学稳健性对特征进行评判,这相当于机器给机器批改作业。比没有强,但仍差临床医生的签字确认一步。
该流水线或许不再需要人工处理每个特征。但它仍然需要真实患者来证明自己,而这一部分尚未实现自动化。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。