脑机网 脑机网LOGIC.WANG
ESC

赢了26名医生中的23个,他们为什么选择开源?

9 月 18 日凌晨,一篇论文在国际学术期刊《科学》上线:阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像 AI 模型 DAMO RADAR,面向腹部增强 CT 诊断,可一次性识别 146 种腹部病症。

2026-09-19 · 1437 字 · 脑机网

9 月 18 日凌晨,一篇论文在国际学术期刊《科学》上线:阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像 AI 模型 DAMO RADAR,面向腹部增强 CT 诊断,可一次性识别 146 种腹部病症。

论文里最扎眼的一句是:在覆盖 14 家医院、26 名影像科医生的人机对比试验中,模型的平均诊断准确率超过了其中 23 名医生。

超过 23 名,意味着输给了 3 名。这个留白比"全面超越"更可信。

"最怕进的科室组别"

要理解这件事的分量,得先知道腹部 CT 有多难读。

浙大一院放射科主任肖文波从业 30 余年,她的说法很直白:"你问问年轻医生,他们最怕进的科室组别,就是腹部影像组。"

一份腹部 CT 报告需要覆盖消化、泌尿等多个系统的数十个器官。即便是中高级医生,完成一份报告也需要 20 分钟到半小时。难处在于腹部器官多为软组织,密度相近,病灶识别的难度极高。

长期以来,医疗影像 AI 的通行做法是"一病一模":一个模型只针对一种疾病,从立项到落地往往要两三年。

达摩院高级算法专家张建鹏曾主导研发肺癌、肠癌等单病种 AI 模型,他对这套模式的比喻很传神:"单病种 AI,就像善攻个别题型的学生,固定题型考试成绩优异,换一类题目便无从下手。"

另辟蹊径:让 AI 按医生的方式阅片

转机来自一个思路上的调整。

团队决定借鉴放射科医生的实际阅片方式——以人体解剖结构为核心,依次核查肝脏、胰腺、胆道等器官。为此他们在国际上首创了"器官级细粒度对齐"技术:把 CT 三维数据拆解为独立的器官级解剖单元,在器官层面实现影像数据与诊断报告文本的精准对齐。

这一步解决了两个老问题。一是标注成本——新方法直接学习影像与报告文本的内在关联,无需额外人工标注。二是 CT 数据本身的特性——信号稀疏,常规视觉-语言学习效果不佳,拆到器官级别后才实现精确对齐。

最终模型覆盖含恶性肿瘤在内的广泛腹部病症,团队评估了其中 146 种,涉及 18 个器官。在近 4 万例连续临床病例测试中,平均 AUC 达 0.913。

更值得一提的是泛化能力:面对初始训练之外的急腹症场景,AUC 仍达 0.904。对医疗 AI 来说,能在没练过的场景上不掉链子,比在练过的场景上拿高分更有价值。

人机对照的真正含义

再回到那场人机对照试验。

在 AI 提示下,影像科医生识别疾病的敏感性(防漏诊的能力)提高了 10%,阅片耗时减少 30% 以上,并使低年资医生达到了高年资医生的诊断水平。

最后这一句,可能是整篇论文里社会价值最大的部分。

中国医疗资源分布不均,基层医院阅片量有限、医生经验不足。如果模型能让低年资医生达到高年资水平,它真正补的不是"效率",而是"能力差距"。

肖文波的期待很明确:希望这款 AI 能尽快落地基层,助力一线临床诊断。

为什么开源

目前,DAMO RADAR 模型、核心代码及全套技术框架已开源。

在一篇《科学》论文之后选择开源,值得单独说一句。医疗 AI 商业化路径一直拥挤,手握这样的成果,闭源做产品是完全合理的选择。

但团队选择了模型、代码、技术框架全开。逻辑大概是:通用医疗影像 AI 的价值不在于一家公司卖多少套系统,而在于能否成为行业基础设施。

达摩院在医疗 AI 投入已久,先后突破胰腺癌、胃癌、肠癌筛查及主动脉夹层预警,三年内发表 5 篇《自然·医学》和十余篇顶刊。DAMO RADAR 是这条线上的质变——从专病模型跨到通用模型。

留一个问题

模型赢了 23 名医生,输了 3 名。

那 3 名做对了什么?论文没有展开。但这恰恰是接下来最值得研究的问题:人类专家身上尚未被模型学会的东西,到底是什么。

找到它,可能就是下一个突破的起点。

查看「AI大模型」更多内容 → · 返回首页