从'一病一模'到'一模型看146种病':阿里巴巴达摩院DAMO RADAR登上《科学》,通用医疗影像AI与开源普惠路线深度解析

腹部CT被业内公认为"最难读的CT"。一份增强CT往往包含数百张切片,肝脏、胰腺、胆囊、肾脏、脾脏、肠道等数十个软组织器官相互挤压重叠,密度接近,病变信号细微隐蔽,即便中高级放射科医生完成一份报告也需要20分钟到半小时。而今天,这个"临床阿喀琉斯之踵"迎来了来自中国团队的破局者。

2026年9月18日,阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR,正式刊发于国际顶级学术期刊《科学》(Science)正刊,论文链接见 science.org。这是全球首个达到影像科专家水平的腹部CT通用医疗影像AI:单个模型覆盖腹部18个解剖结构,一次性识别超过146种病症与影像学表现,且模型、代码与技术框架已全面开源 人民网

这一成果的意义,不止于把一堆漂亮的AUC数字写进顶刊,更在于它宣告了医疗影像AI技术范式的一次根本性转向——从"一个模型盯一种病"的专用路径,走向"一个模型通读整个解剖区域"的通用路径。通用模型的核心价值是广覆盖,专病模型的核心价值是高精度,两条路线不是谁取代谁,而是在不同临床场景下各展所长 科学网

为什么通用化是医疗影像AI的"硬骨头"

要理解DAMO RADAR含金量,需要先看清此前行业困局。百年来的医疗影像AI研发,几乎都沿着"一病一模"的路径走:肺结节一个模型、胰腺癌一个模型、糖尿病视网膜病变一个模型。这类专病模型在单一病种上往往成绩优异,但代价是沉重的。

专病模型的致命短板有三点。第一是研发周期不可持续。达摩院高级算法专家张建鹏直言,一个病种从立项研发到落地落地往往要两三年,“人类疾病成千上万种,照这个速度一辈子都做不完” 36氪第二是对人工标注的极度依赖。AI要学会识别病灶,需要医生逐张切片去勾画标注,放射科医生的时间极其昂贵,标注过的CT数据集规模天然受限,每个模型训练成本高、耗时长。第三是泛化能力差。专病模型学的是"固定题型",换一种疾病、换一台扫描设备,往往就无从下手。

更关键的是,真实临床世界根本不按"单一病种"运行。一个来医院做腹部CT的患者,影像里可能同时藏着肝脏的占位、胰腺的密度改变、肾脏的结石。医生的工作是通读全片、多器官同步筛查,而专病AI只能回答"他有没有这种病"这一个问题。这就是通用模型存在的价值。

DAMO RADAR的突破口,选在了"先识别解剖结构、再关联病变"这个思路上。它模仿放射科医生真实的阅片逻辑——先依次锁定肝脏、胰腺、胆道等器官,再逐一核查每个器官的异常。达摩院借鉴这个思路,在国际上首创"器官级细粒度对齐"技术 杭州网

DAMO RADAR整体技术架构

DAMO RADAR全称 Rapid Abdominal Diagnosis with AI and Radiology,即"基于人工智能与放射学的快速腹部诊断"。其核心方法论是视觉-语言学习(Vision-Language Learning)。团队的洞见在于:医院的CT影像天然对应一份由医生书写的诊断报告,报告里包含医生对不同器官与病变的细致描述。与其让医生逐张勾画病灶,不如让模型直接学习海量"影像—报告"对的内在关联,让模型自己揣摩"什么样的影像表现对应什么样的疾病"。

但直接把常规视觉-语言学习方法搬到CT上并不奏效,原因在于CT数据信号稀疏——三维影像里真正有意义的信息占比极低,常规的图像-文本对齐手段精度不足。为此,团队设计了两项关键创新:

  • 器官级细粒度对齐(Organ-level Fine-grained Alignment):把三维CT体数据分解为独立的"解剖单元",在组织器官层面让影像与报告文本实现精准对应。模型先学会分辨肝脏、胰腺、胃肠道各自在哪,再把每个器官的影像表现与报告中对该器官的描述关联起来,从而避开大量正常组织背景的干扰。
  • 自适应对比建模(Adaptive Contrastive Modeling):对比学习通常把两个不同样本视为"不相关",但医学上两个肝脏都健康的患者理应被视为相似。自适应对比建模基于医学知识动态调整样本间的关系,从而更精准地建模罕见病变与正常表现的边界。

在架构实现上,DAMO RADAR采用三维视觉分支 + 双语文本编码器 + 对比学习目标的组合。三维视觉分支负责吞入CT体数据(Volume),文本编码器采用BERT家族的编码器,分别处理中文与英文报告,再通过对比学习目标拉近"正确影像—报告对"的距离 navsplace。整个模型还输出注意力热图(Attention Maps),让临床医生能直接看到是哪一块区域、哪一层切片的哪个特征驱动了预测,这一可解释性特性,是纯文本医疗聊天机器人所不具备的、实打实的安全边界。

训练数据方面,团队构建了专门的腹部增强CT数据集RAD-CT,包含424,911例增强腹部CT检查,据此生成了约1500万条"解剖感知"的影像-文本对。由于直接学习医院已有的临床报告而非人工勾画标注,这样一个规模的数据集才得以低成本、高效率地构建出来 navsplace

图1:DAMO RADAR整体架构(输入→多器官定位→多病种分类)

                         DAMO RADAR 整体架构
┌──────────────────────────────────────────────────────────────────┐
│                      腹部增强CT 体数据输入                          │
│                    (数百张轴向切片, 数十个器官)                     │
└───────────────────────────────┬──────────────────────────────────┘
                                │
                                ▼
┌──────────────────────────────────────────────────────────────────┐
│        ① 三维视觉分支 (3D Vision Encoder)                         │
│         · 将CT体数据编码为三维特征表示                             │
│         · 将体数据分解为独立"解剖单元"(器官级)                     │
└───────────────────────────────┬──────────────────────────────────┘
                                │ 器官级特征
                                ▼
┌──────────────────────────────────────────────────────────────────┐
│        ② 双语文本分支 (BERT Encoder)                              │
│         · 中文报告编码 ──┐                                        │
│         · 英文报告编码 ──┼── 影像-文本对比学习                     │
└───────────────────────────────┬──────────────────────────────────┘
                                │ 对齐
                                ▼
┌──────────────────────────────────────────────────────────────────┐
│        ③ 多病种分类头 (146 findings / 18 structures)              │
│         · 器官级病灶定位 (Liver/ Pancreas / Kidney / GB ...)     │
│         · 征象级分类 (肿瘤/炎症/出血/梗阻/结石 ...)                │
│         · 注意力热图 (可解释性)                                    │
└───────────────────────────────┬──────────────────────────────────┘
                                │
                                ▼
┌──────────────────────────────────────────────────────────────────┐
│        输出: 结构化诊断提示 + 区域级注意力热图                       │
│         → 供放射科医生复核与临床决策                                │
└──────────────────────────────────────────────────────────────────┘

图2:“一病一模"专用模型 vs DAMO RADAR 通用模型对比

    "一病一模"专用路径                    DAMO RADAR 通用路径
┌─────────────────────┐            ┌─────────────────────────────┐
│ 肺结节AI (专用)      │            │                             │
│ 胰腺癌AI (专用)      │            │       一个模型通读            │
│ 胃癌AI   (专用)      │            │      腹部全部器官            │
│ 肠癌AI   (专用)      │            │     (18 结构 / 146 病变)      │
│ 视网膜AI (专用)      │            │                             │
│ ... 每种病一个模型    │            │  多器官同步筛查, 一次输出     │
└─────────────────────┘            └─────────────────────────────┘
    高精度(单病种)                       广覆盖(多病种)
    依赖海量人工标注                     直接学习临床报告
    研发周期 2-3 年/病种                  无需额外人工标注
    泛化能力差                           急诊场景仍可迁移

多中心临床验证:一场严谨的"体检”

学术论文可以包装,但数字骗不了人。为了证明DAMO RADAR不是实验室里的"样子货",团队设计了一套严格到近乎苛刻的多层验证体系,覆盖从内部真实世界队列、外部多中心、病理金标准,到人机对比的完整链条。

首先看内部真实世界队列。在近3.9万例真实世界连续腹部增强CT检查、覆盖146种影像学表现的评估中,DAMO RADAR的平均AUC达到0.913(置信区间0.911至0.915)。AUC是衡量诊断模型区分"患者"与"正常者"能力的核心指标,1代表完美区分,0.5等于盲猜,超过0.9即属优异 人民网

真正的考验在外部泛化。团队在8家外部医院、超过2.4万例CT上做验证,这些数据覆盖不同地区、不同扫描设备,结果DAMO RADAR的AUC区间为0.874至0.912;即使在无微调的跨人群队列上,AUC仍达0.883 navsplace

最硬核的是与病理金标准的对照。在肝癌、胰腺癌、胃癌、结直肠癌四种恶性肿瘤上,团队以病理活检为金标准考核模型,AUC达到0.891至0.984。这意味着模型对肿瘤的识别不是"猜个大概",而是与病理结果高度吻合。

DAMO RADAR还经受住了急诊场景的检验。急诊与常规门诊截然不同——时间紧迫、造影剂来不及发挥最佳效果、患者未必能配合,成像质量偏差。而急诊恰恰不在训练目标之内。团队用约2.7万例急诊数据测试,结果表明模型在急腹症识别上AUC依然高达0.904,展现出原生良好的泛化能力 36氪

图3:多中心临床验证流程

   DAMO RADAR 多层临床验证体系
┌─────────────────────────────────────────────────────────────────┐
│ ① 内部真实世界队列                                              │
│    ~3.9万例 / 146病变 / 18结构  →  平均AUC = 0.913 (0.911-0.915) │
└────────────────────────────────┬────────────────────────────────┘
                                 │
┌────────────────────────────────▼────────────────────────────────┐
│ ② 外部多中心泛化验证                                           │
│    8家外部医院 / >2.4万例 / 多地区多设备                          │
│    → AUC 0.874 - 0.912 ; 跨人群无微调 0.883                     │
└────────────────────────────────┬────────────────────────────────┘
                                 │
┌────────────────────────────────▼────────────────────────────────┐
│ ③ 病理金标准对照                                                │
│    肝癌/胰腺癌/胃癌/结直肠癌  →  AUC 0.891 - 0.984               │
└────────────────────────────────┬────────────────────────────────┘
                                 │
┌────────────────────────────────▼────────────────────────────────┐
│ ④ 急诊场景泛化 (训练外)                                         │
│    ~2.7万例急腹症  →  AUC 0.904                                 │
└────────────────────────────────┬────────────────────────────────┘
                                 │
┌────────────────────────────────▼────────────────────────────────┐
│ ⑤ 人机对比 (Reader Study)                                      │
│    14家机构 / 26名放射科医生 / 300例患者                          │
│    模型平均表现超越 23/26 名医生                                  │
│    AI辅助: 敏感性 +10% , 阅片时间 -30.7%                         │
└─────────────────────────────────────────────────────────────────┘

人机对比试验的结果,是DAMO RADAR"专家级"成色的直接证明。团队邀请来自14家医疗机构的26名影像科医生参与测试,其中包括11名资深医生和15名初级医生,医生和模型分别对300名患者的CT影像进行判断。结果显示,DAMO RADAR的平均表现超过了其中23名医生,仅3名资深放射科医生的表现略高于模型 科学网

但DAMO RADAR的设计哲学,从来不是替代医生。在人机协作的读片测试中,在AI提示辅助下,放射科医生识别疾病的敏感性(防漏诊能力)提高了约10%,平均每例阅片时间减少30.7%,并且部分测试中,获得AI辅助的初级影像科医生,其敏感性超过了资深医生 科学网。这一结果直指通用医疗影像AI最有想象力的价值出口:把低年资医生快速拉升到高年资专家的诊断水平,这正是基层医院最迫切的需求。

这些临床验证指标(平均AUC 0.913、敏感性提升10%、阅片时间减少30.7%)并非随手可得,它们在工程上通常由一套严谨的指标计算管线产出。下面用Python给出一个"多中心临床验证指标计算"的示意实现,涵盖AUC、敏感性、特异性与Bootstrap置信区间,反映研究成果量化上报的标准流程:

# validation_metrics.py
import numpy as np
from sklearn.metrics import roc_auc_score


def bootstrap_ci(y_true, y_score, n_boot=1000, seed=42):
    rng = np.random.default_rng(seed)
    aucs = []
    idx = np.arange(len(y_true))
    for _ in range(n_boot):
        s = rng.choice(idx, size=len(idx), replace=True)
        if len(np.unique(y_true[s])) < 2:
            continue
        aucs.append(roc_auc_score(y_true[s], y_score[s]))
    lo, hi = np.percentile(aucs, [2.5, 97.5])
    return float(np.mean(aucs)), lo, hi


def sensitivity_specificity(y_true, y_score, threshold=0.5):
    y_pred = (y_score >= threshold).astype(int)
    tp = np.sum((y_pred == 1) & (y_true == 1))
    fn = np.sum((y_pred == 0) & (y_true == 1))
    tn = np.sum((y_pred == 0) & (y_true == 0))
    fp = np.sum((y_pred == 1) & (y_true == 0))
    sens = tp / (tp + fn) if (tp + fn) else 0.0
    spec = tn / (tn + fp) if (tn + fp) else 0.0
    return sens, spec


if __name__ == "__main__":
    rng = np.random.default_rng(0)
    y_true = rng.integers(0, 2, size=2000)
    y_score = rng.uniform(0, 1, size=2000)
    auc, lo, hi = bootstrap_ci(y_true, y_score)
    sens, spec = sensitivity_specificity(y_true, y_score)
    print(f"mean AUC={auc:.3f} 95%CI=[{lo:.3f},{hi:.3f}] "
          f"sens={sens:.3f} spec={spec:.3f}")

DAMO RADAR 的中文/英文路径与开源部署推理

在真实系统里,DAMO RADAR的中文与英文报告分别走BERT中文/英文编码路径,并在影像科PACS侧以服务化方式部署。下面示意其推理服务的HTTP入口逻辑(Python):

# radar_service.py
import numpy as np


class RadarService:
    def __init__(self, detector, bilingual=True):
        self.detector = detector
        self.bilingual = bilingual

    def diagnose(self, volume: np.ndarray, lang="zh"):
        findings = self.detector(volume)          # (region, scores) list
        out = []
        for organ, score_map in findings:
            top = max(score_map, key=score_map.get)
            out.append({"organ": organ,
                        "top_finding": top,
                        "top_score": round(score_map[top], 4),
                        "lang": lang})
        return {"finding_count": len(out), "items": out}

藏在医学检测架构里的工程细节

从工程视角拆解,DAMO RADAR的"通用性"不是靠堆数据堆出来的,而是靠一套精心设计的医学检测管线。我们把它的工作流程抽象为一条可运行的诊断流水线,就能看清背后"解剖定位→逐器官分类→征象聚合"的三段式设计。

在多器官解剖结构检测层面,模型并不直接对整幅CT做端到端的疾病判断,而是先做器官级定位——在三维体数据中把肝脏、胰腺、肾脏、胆囊等18个解剖结构"框"出来,划分出各自的"领地"。这相当于先划定问题域的边界,再在边界内做精细判断。器官定位的意义在于,它把"在数百张切片里大海捞针找可能的病灶"这个病态问题,转化成了"在已知器官区域内判断有无异常"这个良态问题,从而显著压低假阳性和漏检率。

在多病种分类层面,每个被定位的器官区域会进一步喂给多任务分类头,同时输出器官级病灶诊断(如"肝占位")、征象级表现(如"腹腔积液"“肠梗阻”)以及置信度。最终这些多层级输出被聚合成一份"结构化诊断提示",告诉医生"哪个器官、什么区域、可能是哪种问题、依据是什么(注意力热图)"。

图4:一模型多病种——器官定位到多分类的决策流程

   单个CT体数据 → 一模型多病种决策树
┌──────────────────────────────────────────────────────────────┐
│                      三维CT体数据                              │
└──────────────────────────┬───────────────────────────────────┘
                           │  器官级定位
        ┌──────────────────┼──────────────────┐
        ▼                  ▼                  ▼
  ┌──────────┐      ┌────────────┐      ┌────────────┐
  │  肝脏区域  │      │  胰腺区域   │      │  肾脏区域   │ ...
  └────┬─────┘      └─────┬──────┘      └─────┬──────┘
       │  多任务分类       │  多任务分类        │  多任务分类
       ▼                  ▼                  ▼
  ┌──────────────────────────────────────────────────┐
  │   多病种分类头 (146 findings)                    │
  │  ├ 器官级病灶: 肝占位/胰腺形态改变/肾结石 ...      │
  │  ├ 征象级表现: 腹腔积液/肠梗阻/腹主动脉瘤 ...      │
  │  ├ 恶性肿瘤:  肝/胰/胃/结直肠 (病理金标准验证)     │
  │  └ 置信度 + 注意力热图                            │
  └──────────────────────────────────────────────────┘
                           │
                           ▼
               输出结构化诊断提示给医生复核

为了把这段描述落到工程层面,下面给出一个用Python简化的"腹部CT切片多任务分类管线"骨架。它反映了DAMO RADAR"器官定位→逐器官多病种分类→征象聚合"的核心思想——当然,真实模型使用三维体数据端到端处理,这里用二维切片示意其多任务分层逻辑:

# multi_task_abdominal_pipeline.py
import numpy as np
from typing import Dict, List, Tuple

FINDING = {
    "liver":    ["focal_lesion", "cirrhosis", "normal"],
    "pancreas": ["mass", "necrosis", "dilated_duct", "normal"],
    "kidney":   ["stone", "cyst", "hydronephrosis", "normal"],
}


def organ_localization(vol: np.ndarray) -> Dict[str, Tuple[int, int]]:
    """DAMO RADAR-style: decompose 3D volume into anatomical units."""
    organs = list(FINDING.keys())
    n = vol.shape[0]
    step = n // len(organs)
    return {o: (i * step, (i + 1) * step) for i, o in enumerate(organs)}


def classify_region(region: Tuple[int, int]) -> Dict[str, float]:
    """Per-region multi-task classification head over 18 structures."""
    # 示意各 finding 的 logit 概率, 实为三维网络输出
    return {f: float(np.random.rand()) for f in FINDING.keys()}


def run_inference(vol: np.ndarray) -> Dict[str, Dict[str, float]]:
    boxes = organ_localization(vol)
    return {o: classify_region(r) for o, r in boxes.items()}


if __name__ == "__main__":
    fake = np.random.rand(150, 256, 256)          # 150 CT slices
    for organ, _ in run_inference(fake).items():
        print(f"scan organ: {organ}")

这段代码只是"示意骨架"——真实DAMO RADAR是端到端的三维视觉-语言模型,不是逐切片独立判断,但它清晰体现了"解剖单元划分+多任务分类+征象聚合"这一把"通用性"落到工程的核心分层模式。

人机协作与临床工作流集成

通用医疗影像AI要真正救患者,最终要落进医院的PACS(影像归档与通信系统)工作流。DAMO RADAR被浙大一院放射科主任肖文波比作"导航软件"——它不是替你开车,而是在你读片时实时提示前方哪里有"坑"、哪些区域值得重点查看。

这种定位决定了它在临床中的集成方式。在典型影像科工作流里,CT检查完成后图像自动上传PACS,DAMO RADAR作为AI辅助引擎并行分析,产出的结构化提示与注意力热图随图像一并呈现给阅片医生。医生拿到的是"AI初步筛查意见 + 可解释的区域级热图",在此基础上按需确认或推翻,最终签字出具报告。整个闭环中,医生始终是最终决策者,AI的价值在于降低漏诊、压缩耗时、把初级医生拉升到专家水平。

36氪的报道中提到一个耐人寻味的细节:合作医院的医生没有因这一成果而担忧"失业",反而希望模型尽快落地更多科室,认为AI能缓解人手紧张、提升影像科职业成就感,而医生仍将在疑难病例决策和综合诊疗中发挥核心作用 36氪。这与辛顿老爷子2016年"该停止培养放射科医生"的激进预言形成鲜明反差——十年过去,医疗成了AI屡屡碰壁的"阿喀琉斯之踵",因为在这里,模型幻觉不是一笑了之,而是人命关天。DAMO RADAR选择"辅助"而非"替代",恰恰是对医疗敬畏的体现。

图5:腹部CT临床工作流集成(人机协作闭环)

  腹部CT临床工作流集成 (人机协作闭环)
┌────────────┐     ┌────────────────────┐     ┌───────────────┐
│ CT扫描成像  │ ──▶ │ 影像自动上传 PACS     │ ──▶ │ DAMO RADAR     │
└────────────┘     └────────────────────┘     │ AI辅助引擎     │
                                               │ (并行分析)      │
┌────────────┐     ┌────────────────────┐     └───────┬───────┘
│ 原始影像切片 │ ◀── │ 医生阅片工作站        │ ◀─────────┘
└────────────┘     │  · 显示AI结构化提示     │     · 识别18结构/146病变
                   │  · 叠加注意力热图        │     · 输出诊断提示+热图
                   │  · 医生按需确认/推翻      │
                   └──────────┬─────────────┘
                              │ 最终签字
                              ▼
                        出具影像诊断报告

在IT工程落地层面,影像科通常以Go等语言构建与PACS对接的中间服务,负责调取符合DICOM标准的CT序列、筛选增强期相、再交给AI推理服务。下面是一段示意性的Go影像队列调度代码,反映"AI辅助读片"在医院一侧的接入方式:

// pacs_dispatcher.go
package main

import (
	"context"
	"log"
	"sync"
)

type Volume struct {
	PatientID string
	Series    []string // DICOM 图像URL列表
}

type RadarClient interface {
	Diagnose(ctx context.Context, vol *Volume) (string, error)
}

type Dispatcher struct {
	client      RadarClient
	workerCount int
}

func (d *Dispatcher) Run(ctx context.Context, jobs <-chan *Volume) {
	var wg sync.WaitGroup
	for i := 0; i < d.workerCount; i++ {
		wg.Add(1)
		go func() {
			defer wg.Done()
			for v := range jobs {
				out, err := d.client.Diagnose(ctx, v)
				if err != nil {
					log.Printf("diagnose %s: %v", v.PatientID, err)
					continue
				}
				log.Printf("hint for %s: %.30s", v.PatientID, out)
			}
		}()
	}
	wg.Wait()
}

func main() {
	ctx := context.Background()
	jobs := make(chan *Volume, 64)
	disp := &Dispatcher{client: nil, workerCount: 4}
	go func() {
		jobs <- &Volume{PatientID: "P1001"}
		close(jobs)
	}()
	disp.Run(ctx, jobs)
}

注:上文Go片段为示意并发调度模式,演示"PACS取图→AI诊断→提示回传"的接入框架;真实工程以官方开源仓库为准。

开源普惠:技术不锁在高墙内

如果说技术成色决定DAMO RADAR能走多远,那么开源策略则决定了它能让多少人受益。在这方面,达摩院做出了一个对全球医学界意义深远的选择:模型权重与核心代码、全套技术框架全面开源 杭州网

具体而言,开源遵从"代码与权重分层授权"的常见做法:代码在GitHub上以Apache 2.0协议开放,科研团队可以自由研究、修改、二次开发管线;模型权重在Hugging Face上以CC BY-NC-SA 4.0(非商业、可分享同授)协议发布。两者合读的潜台词是:医院IT团队可以自由研究这套管线,但任何要在已发布权重之上做商业产品的团队,需要另行与达摩院沟通授权安排 navsplace。这是开源医学AI领域常见的、为了避免算法被滥用于收费诊断而设置的安全闸门。

据公开资料,模型推理可在单张NVIDIA A100或H20数据中心GPU上运行,多GPU则加速大规模处理;而完整重训则远超消费级硬件的能力——开发者使用了24块此类GPU intelligentliving

图6:开源部署拓扑(GitHub / Hugging Face → 全球医疗科研机构)

                    DAMO RADAR 开源部署拓扑
┌───────────────────────────────┐
│       阿里巴巴达摩院            │
│  发布 · 维护 · 更新            │
└──────┬────────────────────────┘
       │ 开源
       ├───────────────────────────────┐
       ▼                               ▼
┌────────────────────┐       ┌────────────────────────┐
│ GitHub (Apache 2.0) │       │ Hugging Face            │
│ · 模型代码/微调脚本  │       │ (CC BY-NC-SA 4.0)        │
│ · 推理管线/文档       │       │ · 模型权重 (checkpoint)  │
└─────────┬──────────┘       └───────────┬────────────┘
          │  全球科研/医疗机构自由获取     │
          ▼                              ▼
  ┌─────────────────────────────────────────────┐
  │ 本地部署  (单卡 A100/H20 即可推理)            │
  │ · 医院PACS集成 · 本地数据验证 · 微调适配       │
  │ · 科研复现   · 独立第三方验证                 │
  └─────────────────────────────────────────────┘

这一开源选择,折射出中美AI发展路线的深刻分野。斯坦福大学《AI Index 2026》报告显示,84%的中国受访者对AI持积极态度,而美国这一比例仅38% 悦居/头条转载。不少分析认为,民众对AI的乐观,根源在于技术落地的普惠路径。医疗领域的收费差异直观地放大了这种路线差距:国内公立医院CT检查费用约200元人民币,而美国同类CT账单可达7000美元,高昂成本让普通民众就医负担沉重 悦居/头条转载

图7:中美医疗AI路线对比

                    中美医疗AI路线对比
┌─────────────────────────────┬─────────────────────────────┐
│          中国路线            │          美国路线            │
├─────────────────────────────┼─────────────────────────────┤
│ 强调普惠开放                 │ 头部企业偏好闭源模式          │
│ 顶尖成果选择开源模型与代码     │ 技术使用按次收费, 筑技术壁垒   │
│ 全球科研医疗机构可二次研究      │ 商业化授权受限               │
├─────────────────────────────┼─────────────────────────────┤
│ 公立医院CT: ~200元人民币       │ 同类CT账单: ~7000美元        │
├─────────────────────────────┼─────────────────────────────┤
│ 84%民众对AI持积极态度          │ 38%民众对AI持积极态度         │
│ (斯坦福《AI Index 2026》)     │ (斯坦福《AI Index 2026》)     │
└─────────────────────────────┴─────────────────────────────┘
    AI Index 数据来源: 悦居/头条转载整理

对基层医院而言,这套开源策略称得上雪中送炭。基层医院阅片量有限、医生临床经验相对不足,腹部CT阅片难度更大,而通用模型作为"永不疲劳的辅助眼睛"正可补齐这一短板 杭州网。让技术惠及更多普通人,把尖端成果从"高墙"里释放出来,正是普惠医疗AI的应有之义。

下面给出一个面向影像科工程师的Python推理脚本示例,演示如何加载DAMO RADAR权重并在本地CT体数据上跑通用诊断(示意接口,真实脚本以官方仓库为准):

# radar_inference_demo.py
import numpy as np


def run(ct_volume: np.ndarray, region_box: tuple, encoders, tokenizer):
    """Run RADAR-style universal diagnosis on a local CT volume."""
    z0, z1, y0, y1, x0, x1 = region_box  # 器官边界框
    patch = ct_volume[z0:z1, y0:y1, x0:x1]
    visual = encoders["vision"](patch[None])
    probs = {}
    for finding in ["肝占位", "胰腺癌", "肾结石", "胆囊炎", "肠梗阻"]:
        text = encoders["text"](tokenizer(finding, return_tensors="pt"))
        probs[finding] = float((visual * text).sum().sigmoid())
    return sorted(probs.items(), key=lambda kv: -kv[1])

从腹部CT到通用医疗影像:未来的泛化路径

DAMO RADAR当前聚焦腹部,但它的真正野心不止于此。团队明确表示,这套"器官级细粒度对齐 + 自适应对比建模 + 视觉语言学习"研究范式,不仅可用于腹部CT的多病种识别,还有望迁移到其他形态的医疗影像,从而加速通用人工智能的到来 人民网

这条泛化路径在技术上是清晰可循的。此前开源放射学通用模型如RadFM、斯坦福的CheXagent,要么覆盖不同模态、要么聚焦胸部X光,尚无人攻克结构更复杂、软组织更多、密度更接近的腹部CT;DAMO RADAR切入的,恰恰是一片相对开阔的空白领地 navsplace。当"解剖单元级对齐"的方法论被验证有效后,它天然可以平移到胸部(肺、纵隔、心脏)、盆腔、头颈部等解剖区域,甚至是MRI、超声、PET等其他模态。

更深层的意义在于方法论的可复制性。DAMO RADAR证明了**“从医院海量现成的’影像—报告’里直接学通用诊断”**这条路的可行性——它绕开了困扰医疗AI十年的"人工标注瓶颈",让"通用化"第一次有了规模化落地的基础。放射科医生时间昂贵、标注CT数据集普遍偏小,而直接学习医生已写好的自由文本报告,等于把数十万例真实临床知识"零标注"地喂给模型,这正是它能一个模型覆盖146种病变、而非146个模型的技术根基 navsplace

图8:未来泛化路径(腹部CT → 多部位 / 多模态)

        DAMO RADAR 研究范式的泛化路径
┌───────────────┐  解剖单元级对齐 + 视觉语言学习 + 自适应对比建模
│  腹部增强CT     │ ────────────────────────────────────────────┐
│  (已验证)      │                                             │
└───────────────┘                                             │
   18结构/146病变                                               │
   AUC 0.913                                                    │
        │                                                       ▼
        ├──────────────►  ① 胸部 CT  (肺/纵隔/心脏)              
        ├──────────────►  ② 盆腔 CT  (子宫/前列腺/膀胱)          
        ├──────────────►  ③ 头颈部 CT (颅脑/颈部软组织)          
        ├──────────────►  ④ MRI      (软组织分辨更精细)          
        └──────────────►  ⑤ 超声     (实时/无电离辐射)           
                                                                
        ┌──────────────────────────────────────────────────┐
        │ 终点: 覆盖多部位、多模态的通用医疗影像人工智能       │
        │  (推动医疗行业朝 AGI 时代迈进)                     │
        └──────────────────────────────────────────────────┘

需要清醒看到的是,任何顶刊论文都存在边界。DAMO RADAR的研究方也承认若干局限:敏感性提升数据未明确区分"绝对提升"与"相对提升";人机对比是研究者自行设计框架的"读片研究(Reader Study)“而非真正的随机临床试验,未测量患者结局;第三方复现仍待推进 navsplace。此外,截至2026年9月,该模型尚未获得临床审批,定位是供研究、验证与进一步开发的科研模型 intelligentliving。这些边界恰恰提醒行业:专家级的纸面数字,距离监管批准与床旁落地,还有一段严肃的路要走。

结语:通用医疗影像AI的"雷达"已经亮起

回到开篇那个问题:为什么是腹部CT?因为它是最难的之一;为什么是DAMO RADAR?因为它做到了"最难CT"上的专家级通用识别。当达摩院用三年时间、五篇《自然·医学》和这一次《科学》正刊,把自己在胰腺癌、胃癌、肠癌等专病上的积累,凝聚成一个能通读整片腹部的单一通用模型时,医疗影像AI的时代叙事已经被改写——“一病一模"的辐射科AI时代,比大多数医院采购流程能跟上的速度更快地走向终结 navsplace

更重要的是,这是一次"技术"与"路线"的双重胜利:技术上,它用器官级细粒度对齐破解了CT信号稀疏下的通用建模难题;路线上,它用全面开源践行了普惠医疗AI的价值立场。当一个能识别146种疾病、达到专家级水平的医疗模型,连同代码和权重一起向全球开放时,它推向世界的就不仅是诊断精度,更是一种信念——先进技术应当走出高墙,去照亮更多普通人的健康之路

下一步,我们需要观望的,是独立的多中心验证能否复现论文数字,是监管决策能否让模型走向床边,是基层医院能否用上这双"永不疲劳的辅助眼睛”。无论如何,医疗影像AI的通用化大门,已经由这项来自杭州实验室的成果缓缓推开。