CARE-X 医疗AI
轻度主动脉扩张:初诊阅片仅检出12%,使用测量型VLM检出率达93%
主动脉扩张在胸部X光片上很少被量化,轻度病例常被漏诊:43例中初诊仅检出5例。工具增强的VLM检出了40例。CARE-X新研究解释了为什么放射学AI需要尺子,而不仅仅是眼睛。

43例中的5例。这是2026年EACTS会议接收的一项研究中,初次胸部X光阅片检出的CT确诊轻度主动脉扩张病例数。一种测量驱动的AI方法检出了43例中的40例:敏感性93%,对比12%。主动脉增宽通常不是胸部X光检查的主要适应证,也不会在X光片上常规量化,因此临界病例一直处于隐匿状态,直到因其他适应证进行的CT扫描偶然将其显现。研究笔记将延迟检出与不良心血管结局联系起来。
进行该测量的模型并非CARE-X。该实验是同一笔记中描述的一项独立研究工作,将Qwen3-VL-4B-Instruct与确定性测量工具配对。VLM通过多轮循环保留对X光片的视觉访问,在回答前调用工具识别解剖标志、计算测量值并评估诊断阈值。CARE-X是配套部分:一个统一的胸部X光视觉语言模型,在单次前向传播中结合自由文本报告生成与校准的结构化预测。
当肉眼观察不够时,加入一把尺子
某些放射学发现由数字而非模式定义。心脏增大意味着计算心脏和胸腔宽度及其比值。纵隔增宽、主动脉结增大、升主动脉或降主动脉扩张,都依赖于模型应计算而非目测近似的测量值,同时需考虑投照体位、曝光和患者旋转。在无任务特定训练的情况下,工具增强管线的性能在所评估的每项基于测量的疾病上都优于纯感知推理:
| 疾病 | 纯感知F1 | 工具增强F1 | 提升 |
|---|---|---|---|
| 心脏增大 | 74.56 | 96.00 | +21.4 |
| 纵隔增宽 | 72.63 | 97.47 | +24.8 |
| 主动脉结增大 | 60.31 | 99.76 | +39.5 |
| 升主动脉扩张 | 39.33 | 100.00 | +60.7 |
| 降主动脉扩张 | 28.57 | 100.00 | +71.4 |
| 平均值 | +43.6 |
最大的提升位于临床危险端。降主动脉扩张从纯感知的28.57 F1提升至工具的完美100;升主动脉从39.33提升至100。在一个由122例CT确诊阳性病例组成的门诊队列中,工具变体达到了94.26%的召回率,比最佳纯感知基线高出10.65个百分点。在EACTS研究中,测量驱动方法在43例轻度主动脉扩张病例中检出40例,而初次阅片仅检出5例,发现了35例此前被漏诊的轻度病例。
这些数字只衡量召回率,作者也对此作了说明。在分诊中,漏诊通常是代价更高的失败,这也是研究聚焦于此的原因;但一个标记所有内容的模型会获得完美召回率,在临床实践中却毫无用处。一项包含CT确诊阴性队列的扩展研究正在进行中。
CARE-X:一个模型,两种回答方式
CARE-X构建于SigLIP2-so400M视觉编码器和Phi-4-mini-instruct(3.8B)语言模型之上,通过轻量适配器连接,并与语言目标共同训练用于分类和定位的任务特定辅助头。双推理意味着一次前向传播同时产生自回归文本响应和携带置信度分数的辅助头预测。由于这些分数经过校准,阈值可以移动:在0.5时模型返回0.943敏感性,在0.6时返回0.927阳性预测值。临床医生可以从一次传播中在高敏感性筛查和高特异性确认之间切换,这是纯生成架构无法提供的。
使用DAPO的强化学习缩小了生成与结构之间剩余的差距。在Chest ImaGenome的解剖定位任务上,DAPO训练的生成输出达到了0.868 mAP,略高于SFT检测头的0.865;辅助定位头在PadChest上将短语定位提升了24.6个百分点的mAP和14.1个百分点的mIoU。截至2026年8月,CARE-X还在ReXrank ReXVQA排行榜上位列第一,在41,007个问答对中准确率达94%,比表现次佳的公开模型高出6个百分点,并在MIMIC-CXR、IU-Xray、CheXpert-Plus和ReXGradient的大多数指标上取得最强表现。
印度临床数据上的罕见疾病
团队与Medha AI和Narayana Health合作,在Narayana Health的1,047张去标识化胸部X光片上验证了CARE-X,覆盖五种罕见、高严重度疾病,患病率介于2.6%至5.2%之间。CARE-X在五种疾病中的三种上取得了最高敏感性:
Narayana Health队列中各疾病的敏感性。
| 疾病 | CARE-X | CheXOne | MedGemma |
|---|---|---|---|
| 骨折 | 0.62 | 0.41 | 0.05 |
| 纵隔移位 | 0.83 | 0.80 | 1.00 |
| 气腹 | 0.89 | 0.67 | 0.00 |
| 气胸 | 0.83 | 0.85 | 0.52 |
| 导管和管路位置异常 | 0.66 | 0.03 | 0.18 |
气腹的敏感性为0.89,特异性为0.94。最大的差距出现在导管和管路位置异常:0.66,对比CheXOne的0.03和MedGemma的0.18。MedGemma在纵隔移位上的完美1.00伴随着0.53的特异性,这一权衡使得原始敏感性单独呈现时具有误导性。
数字未说明的部分
这些成果均未达到临床可用程度。CARE-X是研究模型,不是微软产品,也不是医疗设备。它未获得任何监管机构的许可或批准,也不用于临床诊断、筛查或患者照护。这些结果是回顾性研究结果,不能确立任何临床用途的安全性、有效性或适用性。测量实验独立于CARE-X,其最强结果仅覆盖具有CT确诊金标准的阳性病例。
通往筛查工具之路
测量方向已有关注:基于AI的主动脉扩张筛查应用入选2026年世界医院大会IHF创新中心的展示决赛。CARE-X路线图包括结构化报告生成、更丰富的鉴别诊断支持、更紧密的工具集成,以及超越图像本身的临床背景,如实验室结果和患者病史。
就目前而言,持久的核心发现是分工。VLM理解图像并定位证据;工具对解剖标志进行算术计算。对于依赖阈值的诊断,正是这种分工将12%的检出率提升到了93%。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。