MedCLIPSeg:用概率化视觉语言融合做更可靠的医学图像分割

Date 2026-08-05 · Category tech · Status finished · Confidence likely
论文解读, 计算机视觉, 图像分割

论文信息

论文题目:MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

作者:Taha Koleilat、Hojat Asgariandehkordi、Omid Nejati Manzari、Berardino Barile、Yiming Xiao、Hassan Rivaz。

来源:2026 年 2 月发布的 arXiv 预印本,版本为 v1。本文中的实验数字、数据集划分和实现设置均以该版本为准。

论文地址:arXiv:2602.20423

项目页:MedCLIPSeg

先看结论

MedCLIPSeg 的目标不是单纯把 CLIP 接到一个分割解码器上,而是同时解决医学图像分割的三个部署问题:

  • 像素级掩膜昂贵,少量标注时模型容易学不稳;
  • 病灶和器官边界模糊,确定性模型可能在错误位置仍然过度自信;
  • 换扫描仪、医院、协议或患者群体后,模型可能发生明显的域外性能下降。

作者在 UniMedCLIP 的视觉和语言编码器之间插入 PVL Adapter(Probabilistic Vision-Language Adapter)。这个适配器在多个深层进行双向图文交互,把 Key 和 Value 建模成带方差的概率分布,用方差降低对不可靠 token 的注意力,再用多次随机采样得到平均分割和像素级不确定性。

论文报告的平均数据效率结果如下:

训练标注比例 DSC NSD
10% 81.10 83.94
25% 85.08 87.85
50% 87.18 89.95
100% 88.66 91.35

在域泛化设置中,完整模型的 ID/OOD/HM DSC 为 89.11/79.02/83.76;换成确定性注意力后变为 87.68/63.12/73.40。这说明概率化设计的主要价值不是只提高同分布精度,而是减少换域时的性能坍塌和过度自信。

动机:医学分割为什么需要概率化的图文模型

医学分割的标注单位是像素,而不是一张图片一个标签。专家需要逐像素描出肿瘤、息肉、器官或病灶边界,成本高,且不同专家可能对模糊边界给出不同答案。

此外,医学图像的域变化比普通自然图像更常见。同一个乳腺超声任务,换扫描仪、增益、放大倍数或医院后,图像的纹理和亮度就可能改变;同一个息肉任务,换内镜设备和采集环境后,照明、视角和背景也可能不同。训练数据和测试数据的这种分布变化称为 domain shift

普通 U-Net 或确定性的 CLIP 分割器通常只输出一个掩膜和一个置信度。问题在于,边界不清晰或输入来自未见过的域时,模型可能仍然给出很高的置信度。临床使用更需要的是:模型不仅给出预测,还能指出哪些像素需要人工复核。

图 1:确定性与概率化跨模态融合、域外稳健性和可靠性

图 1 上半部分比较确定性和概率化的图文交互。确定性模型只产生一个分割结果;概率化模型把视觉-文本表示视作分布,并通过均值和熵分别得到平均预测与不确定性。下半部分把两个目标分开画出:Robustness 衡量换域后性能下降,Reliability 衡量置信度是否校准。

方法总览:CLIP、PVL Adapter 与分割头

图 2:MedCLIPSeg 总体结构

图 2 中的雪花表示冻结的 CLIP 编码器,火焰表示新增的可训练模块。整体流程是:

图像 + 文本提示
      -> CLIP 视觉/文本编码器
      -> 多个深层 PVL Adapter
      -> patch-text 相似度
      -> 分割掩膜 + 不确定性图

视觉编码器输出全局 [CLS] token 和局部 patch tokens;文本编码器输出文本 token 和全局 [EOS] token。最终,文本 [EOS] 表示“要找什么”,图像 patch 表示“具体在哪里”,二者的相似度经过上采样后形成像素级分割 logits。

这里的“文本驱动”不是让语言模型直接画出边界。文本负责提供目标语义和空间条件,视觉 patch 负责提供局部纹理与边界证据。原始 CLIP 的 patch token 具有一定空间语义,但医学分割所需的细粒度对应需要额外适配。

PVL Adapter:概率化跨模态注意力

图 3:PVL Adapter 与 AttnPVL

在第 (n) 个 CLIP 深层,视觉 token 和文本 token 先被映射到共享维度:

随后,AttnPVL 采用普通注意力的 Query,但把 Key 和 Value 改造成概率分布。

Key/Value 的均值和方差

通过 softplus 把预测的 log variance 转成正的方差:

方差大的 token 表示不稳定或证据不可靠。例如,清晰的病灶内部通常容易判断,而边界、噪声和未见过的外观可能带来更大的方差。

置信度加权注意力

普通注意力只考虑均值相似度:

MedCLIPSeg 另外计算 Key 方差带来的惩罚项:

最终注意力可以直观写成:

其中 beta=2.35。因此,模型不只问“这个 patch 和目标文本相似吗”,还问“这种相似性有多可靠”。当 beta=0 时,这个机制退化为确定性注意力。

Value 采样与残差门控

Value 使用重参数化技巧采样:

注意力输出为:

之后,输出通过一个可学习门控和原始 Query 残差融合:

门控参数初始化为 sigmoid(0)=0.5,让训练初期平均保留原始特征和新图文特征,避免注意力尚未稳定时发生剧烈更新。

双向交互

PVL Adapter 先让视觉流以文本为上下文更新:

再让文本流以更新后的视觉特征为上下文更新:

最后升维并加回原始 CLIP 特征:

所以 PVL Adapter 的完整特征是:多层、双向、带不确定性惩罚、带随机 Value 采样、保留残差的轻量适配器

分割和软 patch-level 对比学习

最终融合后,视觉 patch 和文本 [EOS] token 先进行 L2 归一化。视觉 patch 经过上采样模块,文本向量经过一个轻量 MLP,使二者维度兼容,然后做点积:

训练目标由 Dice+BCE 分割损失和 SoftCon 组成。SoftCon 对平均池化后的视觉 patch 表示与文本表示进行双向对比,但不把所有非配对文本都当作完全负样本,而是根据文本间相似度构造软目标。

这样可以区分“左上方的小肿瘤”和“左上方的恶性肿瘤”这类语义相近但描述不同的文本,减少硬负样本给细粒度对齐带来的干扰。

实验如何验证这些设计

论文一共使用 16 个数据集,覆盖 5 种成像模态和 6 类器官。实验不是只有一张总表,而是分别回答数据效率、域泛化、组件贡献、提示词质量和不确定性校准问题。

数据集和训练协议

数据效率、完全监督实验使用:

  • BUSI:乳腺超声;
  • BTMRI:脑 MRI;
  • ISIC:皮肤镜;
  • Kvasir-SEG:结肠息肉内镜;
  • QaTa-COV19:胸部 X 光;
  • EUS:胰腺内镜超声。

域泛化实验的源域-目标域为:

源域 目标域(训练时不可见)
BUSI BUSBRA、BUSUC、BUID、UDIAT
Kvasir-SEG CVC-ColonDB、CVC-ClinicDB、CVC-300、BKAI
BTMRI BRISC
ISIC UWaterlooSkinCancer

所有 CLIP 基线使用相同的 UniMedCLIP 主干以尽量保证比较公平。模型使用 Adam、学习率 3e-4、batch size 24 和 cosine annealing;普通数据集训练 100 epochs,EUS 训练 10 epochs。作者声明自身模型不使用验证集选择 checkpoint,而是使用最后一个 epoch。

实验一:少量标注是否仍然有效

作者分别使用训练集的 10%、25%、50% 和 100%,测试集保持不变。下表列出平均 DSC/NSD:

方法 10% 25% 50% 100%
CLIPSeg 74.66 / 77.75 78.31 / 81.34 79.63 / 82.58 84.87 / 87.74
CAT-Seg 78.76 / 81.50 81.12 / 83.92 83.32 / 85.61 85.90 / 88.31
MedCLIPSeg 81.10 / 83.94 85.08 / 87.85 87.18 / 89.95 88.66 / 91.35

相对 CAT-Seg,MedCLIPSeg 在 10% 数据时 DSC 高 2.34 个百分点,25% 时高 3.96 个百分点,50% 时高 3.86 个百分点,100% 时高 2.76 个百分点。这个实验支持的是“更高的数据利用率”,不是“无需像素掩膜”。

实验二:换域后是否稳健

域泛化实验在源数据集上完整训练,然后直接在未见目标数据集上测试,不进行微调。Table 2 中 MedCLIPSeg 的代表性 DSC 为:

场景 源域 DSC 目标域 DSC
乳腺超声 BUSI 85.72 BUSBRA 75.06、BUSUC 84.37、BUID 78.99、UDIAT 74.64
息肉内镜 Kvasir-SEG 90.15 ColonDB 71.90、ClinicDB 80.80、CVC-300 80.82、BKAI 79.15
脑 MRI BTMRI 88.03 BRISC 80.92
皮肤镜 ISIC 92.54 UWaterloo 83.53

这些数字覆盖了不同设备、亮度、放大倍数、视角和采集协议下的跨数据集变化。完整模型的平均 ID DSC 为 89.11,平均 OOD DSC 为 79.02,调和平均 HM 为 83.76。

实验三:组件消融

变体 ID DSC OOD DSC HM DSC
MedCLIPSeg 89.11 79.02 83.76
去掉 PVL Adapter 81.23 55.23 65.75
去掉 gating 87.55 76.79 81.82
去掉 AttnPVL 86.21 74.13 79.71
确定性 MedCLIPSeg 87.68 63.12 73.40
去掉视觉适配 81.50 64.40 71.95
去掉文本适配 88.83 76.40 82.15
去掉双向交互 88.71 77.71 82.85
去掉 SoftCon 87.24 77.08 81.84

这里最值得关注的是两行:

  • 去掉 PVL Adapter 后 OOD DSC 从 79.02 降到 55.23,说明普通 CLIP 表示和分割头不能替代深层概率化融合;
  • 换成确定性注意力后 OOD DSC 降到 63.12,而 ID 只降到 87.68,说明概率建模主要改善域外稳健性,而不是简单提高同域拟合能力。

图 5:适配层位置和置信度权重的消融

图 5 左图显示,PVL Adapter 插入更深层通常更好,在第 10 层附近达到最高 HM DSC 83.76,继续插入到最终层后略有下降。右图显示 beta=2.35 在 ID 和 OOD 之间取得了最佳平衡。

补充图 S1:SoftCon 权重对域泛化的影响

补充图 S1 显示,SoftCon 权重为 0.1 时 ID/OOD 的调和平均最高。去掉 SoftCon 会失去局部图文语义对齐的正则化;权重继续增大则可能过度约束特征空间,导致 OOD 性能回落。

实验四:文本提示的质量是否重要

提示词设计 ID DSC OOD DSC HM DSC
Original:准确、简洁、带位置 89.11 79.02 83.76
Missing Location:没有位置 86.98 77.75 82.11
Overdescriptive:过度冗长 82.93 74.49 78.48
Underdescriptive:只有类别 66.91 49.38 56.82
Contradictory:文字自相矛盾 68.60 63.21 65.79

这说明文本不是形式上的装饰输入。文本需要简洁、准确,并提供有用的空间语义;过短、冗长或互相矛盾的提示都会损害分割。

实验五:不同预训练视觉语言骨干

预训练模型 ID DSC OOD DSC HM DSC
CLIP 88.48 74.81 81.07
PubMedCLIP 86.67 73.05 79.28
BiomedCLIP 88.70 77.08 82.48
UniMedCLIP 89.11 79.02 83.76

UniMedCLIP 在这组设置中表现最好,说明预训练数据是否覆盖多模态医学图像,会直接影响跨域迁移能力。

不确定性实验:模型是否知道自己哪里容易错

图 4:不同数据集上的分割和不确定性图

图 4 的每一列对应一个数据集,依次显示原图、预测与真值叠加、以及不确定性图。高不确定性通常集中在病灶边界和容易发生专家分歧的区域。

作者在 ID/OOD 前景区域上计算不确定性与错误的相关性:

  • ID Spearman:87.57%;
  • OOD Spearman:80.41%。

同时,Brier 分数从确定性基线的 23.9/25.3 降到概率模型的 11.1/11.8。Brier 越低,说明置信度越接近实际正确率。

补充图 S5:预测不确定性与像素错误率

补充图 S5 进一步把不确定性分箱后和像素错误率比较。在乳腺超声、息肉内镜、皮肤镜和脑 MRI 四种成像域中,不确定性升高时错误率总体上升。这支持不确定性图具有风险排序作用,但不代表它可以替代人工判断。

补充图 S2:确定性与概率化模型的假阳性/假阴性

补充图 S2 显示,概率版本在五个乳腺超声数据集上减少了部分假阳性和假阴性区域,并降低了错误量。图 S3 和图 S4 则展示了乳腺超声和息肉内镜跨数据集样例:预测轮廓整体保持稳定,不确定性主要沿目标边界分布。

补充图 S3:乳腺超声跨数据集结果

补充图 S4:息肉内镜跨数据集结果

推理成本与扩展实验

表 S2 给出的单次采样对比中,MedCLIPSeg 使用 18.7M 参数、73.6G FLOPs,推理时间为 1.51 s;CAT-Seg 使用 34.8M 参数、69.7G FLOPs,推理时间为 2.34 s。这里的时间是论文规定硬件和测量协议下的结果,不能直接当作所有设备上的端到端延迟。

默认推理使用 30 次 Monte Carlo 采样。补充表 S4 显示:

采样次数 HM DSC HM Spearman FPS
5 83.52 83.07 24.92
10 83.66 83.44 14.54
20 83.71 83.52 7.64
30 83.76 83.84 5.23

因此,5-10 次采样已经能得到接近 30 次采样的 DSC 和不确定性相关性,在内镜视频等实时场景中可能更实用。

论文还用 M3D-CLIP 替换 2D 图像编码器,在 CHAOS CT Liver 数据集上做了 3D 扩展,报告 DSC 为 88.72%。这说明方法形式上可以扩展到 3D,但当前只是一项补充验证,不足以代表完整的 3D 医学分割评测。

如何理解这组实验

这组实验的证据链比较清晰:

  1. 数据效率实验:证明少量标注下仍有竞争力;
  2. 跨数据集实验:证明模型关注的不只是训练域外观;
  3. PVL/确定性消融:证明概率化注意力是域泛化提升的主要来源;
  4. 提示词消融:证明语言条件的质量会影响空间分割;
  5. 不确定性分析:证明高不确定性与错误区域存在较强对应;
  6. 采样成本实验:说明可靠性可以通过减少 MC 次数换取推理速度。

因此,论文的实验目标不是单纯证明“MedCLIPSeg 的 DSC 更高”,而是分别回答:为什么需要文本、为什么需要深层双向融合、为什么要给 Key/Value 加方差,以及概率输出是否真的能提示错误。

局限与边界

第一,MedCLIPSeg 仍然依赖像素级分割标注。补充 Table S11 显示,去掉分割损失后 ID DSC 约为 20%,OOD DSC 低于 13%,所以“data-efficient”不等于“无需掩膜”。

第二,缺少文本的数据集使用 GPT-5 模板和图像/掩膜属性生成描述。论文没有在当前版本中完全澄清测试阶段构造提示时是否使用真值掩膜,因此自然临床报告在真实部署中的可得性仍需单独验证。

第三,论文把学习到的表示方差解释为 aleatoric uncertainty,把 Monte Carlo 采样解释为 epistemic uncertainty,但没有对两类不确定性进行完全独立的定量分解。

第四,论文是 arXiv v1 预印本,主要结果以单点数字呈现,没有系统报告多随机种子均值、标准差或置信区间。跨设备、跨医院和真实临床工作流中的表现仍需要外部验证。

最后,图 4 和补充图显示“不确定性沿边界集中”是一个有价值的信号,但它更适合作为人工复核的优先级提示,而不是自动批准或拒绝诊断的依据。模型指标本身不能单独证明临床获益。


See also