发生了什么
9 月 17 日,国际学术期刊《科学》(Science)发表论文《An expert-level generalist AI for abdominal CT diagnosis》,作者来自阿里巴巴达摩院与浙江大学医学院附属第一医院等机构。论文提出的模型名为 RADAR(Rapid Abdominal Diagnosis with AI and Radiology),面向腹部增强 CT 这一公认最复杂的影像诊断场景:一份腹部报告要覆盖消化、泌尿等多个系统的数十个器官,软组织之间密度相近,病灶与正常组织的差异往往极细微,中高级医生完成一份报告通常需要 20 分钟到半小时。
与过去「一病一模」的单病种模型不同,RADAR 采用视觉-语言学习框架,直接学习海量临床 CT 影像与诊断报告文本之间的内在关联。团队称其关键是「器官级细粒度对齐」:把三维 CT 数据拆解为独立解剖单元,在器官层面完成影像与报告文本的精确匹配,再以自适应对比建模动态调整,从而无需人工病灶标注即可完成大规模训练。支撑训练的数据集包含逾 40 万份腹部增强 CT 检查、超过 1500 万组器官级图文配对样本,论文公开的核心评估涵盖 18 个解剖结构与 146 种影像学表现。
- 主队列表现:内部真实世界队列近 4 万例连续病例,146 种影像学表现的平均 AUC 达 0.913(AUC 衡量区分患病与未患病的能力,1 为完美区分)
- 多中心验证:8 个外部临床中心共 24239 例 CT,平均 AUC 0.895,在每个单独中心均优于对比模型
- 泛化能力:未经训练的急腹症场景 AUC 仍达 0.904;跨人群零样本测试 AUC 0.883
- 人机对照:26 名放射科医生参与的阅片者研究中,模型平均诊断准确率超过其中 23 名;AI 辅助下医生诊断敏感性提升约 10%,阅片耗时缩短 30.7%
- 可解释与开源:模型可输出注意力热力图,模型权重、核心代码与全套技术框架已全面开源
为什么值得关注
这次发布的价值在于路径切换,而不是又刷了一个榜单分数。单病种模型从立项到落地往往需要两三年,且高度依赖昂贵的人工勾画标注,覆盖病种越窄,越难应付真实门诊里多病并存的复杂情况。RADAR 把标注依赖换成了影像与临床报告的天然配对——医院日常写下的报告本身就构成监督信号,等于让沉睡的临床数据变成训练燃料。这也是它能在单一模型里同时覆盖上百种病变、并且在没见过的急腹症上仍然管用的原因。
对国内医疗体系而言,更直接的落点在基层。基层医院阅片量有限、高年资医生不足,而腹部 CT 恰恰是最依赖经验的判读任务;浙大一院放射科主任医师肖文波在受访时把这类模型比作「智能阅片导航」。达摩院此前已在胰腺癌、胃癌、肠癌、肝癌等单病种方向持续投入,三年内发表多篇《自然·医学》与其余顶刊论文,RADAR 相当于把这些点状成果收拢成一条可复用的通用技术路线,团队表示其范式不限于腹部 CT,可向其他医学影像模态迁移。
仍需观察
论文的验证以回顾性真实世界队列与人机对照试验为主,尚未看到前瞻性临床试验或患者预后改善的终点数据——「AI 读得准」与「患者因此受益」之间仍隔着临床落地的距离。外部泛化方面,跨人群零样本测试使用的是美国公开数据集,仅覆盖 21 种可比病症,完整的多人群、多设备验证仍待补齐。在国内,此类辅助诊断工具的注册审批路径、院内责任划分与定价方式也尚无明确案例。对医院的实际决策点则更朴素:模型虽然开源,但三维 CT 推理的算力开销、与现有 PACS 及报告系统对接的工程量,会决定它能否真正进入日常阅片流程,而不只是停留在论文与演示里。

