MCD-CLIP:让 CLIP 学会联合阅读正位与侧位胸片
论文信息
论文题目:MCD-CLIP: Multi-view Chest Disease Diagnosis with Disentangled CLIP
作者:Songyue Cai、Yujie Mo、Liang Peng、Yucheng Xie、Tao Tong、Xiaofeng Zhu。
出处:IJCAI 2025。
论文地址:IJCAI Proceedings
先看结论
胸部 X 光常有两张片:正位片覆盖胸部的整体信息,侧位片能补充正位投影中重叠、遮挡的区域。普通 CLIP 通常把每张图当作独立样本;MCD-CLIP 则专门处理“同一患者的多个视角”。
它的做法不是把两张胸片直接拼接,而是分成四步:
正位片、侧位片
-> 用有关联的视觉 Prompt 分别进入冻结 CLIP
-> 分别提取共同信息与视角独有信息
-> 每个视角完成图文匹配,再融合两个类别分数
论文在 CheXpert 的 13 个胸部异常任务、五种不确定标签处理设置上报告平均 AUC-ROC 为 0.786。对比方法 MV-HFMD 为 0.775;MCD-CLIP 的可训练参数为 2.05M,MV-HFMD 为 36.05M。这里的重点不是单纯多了 0.011 的平均 AUC,而是模型只更新少量轻量模块,训练参数约少 94.31%。
为什么单张图的 CLIP 不够用
标准 CLIP 会将图像和文本映射到同一个特征空间。例如,模型将一张胸片与两段文本比较:
a photo of normal lungs.
a photo of abnormal lungs.
如果图像特征和“abnormal lungs”文本特征更接近,模型就预测异常。写成公式:
其中, 是图像编码器, 是文本编码器, 是第 类的文本提示, 是温度参数。
问题在于:把正位片和侧位片逐张送入普通 CLIP,模型不会知道它们来自同一位患者。更重要的是,它不会区分两种信息:
- 共同信息:两个视角都支持的病灶证据;
- 互补信息:某一个视角才更容易看到的细节。
传统多视角网络通常在中间特征层或最后分类层做拼接、注意力或 Transformer 融合。MCD-CLIP 的选择是保留 CLIP 的预训练能力,只通过少量外接模块组织多视角信息。
总体结构:两条视角分支,最后在分数层融合

图中的雪花表示冻结参数,火焰表示可训练参数。以一名患者的两张片为例:
两张片都单独经过 CLIP 的图像编码器,得到 。它们并不会在 CLIP 内部直接做跨视角注意力;跨视角关系主要由 Prompt 对齐、共享 Adapter,以及最终分数融合实现。
第一步:视觉 Prompt 不是自然语言,而是可训练向量
图像进入 ViT 前会被切成 patch,形成一串图像 token:
MCD-CLIP 在原有 [CLS] token 与图像 patch token 中间插入 个可训练 Prompt token:
其中 是一组浮点数向量,不是一句由大语言模型生成的英文。它们会参与后续 Transformer 层的注意力计算,从而影响 CLIP 如何组织胸片信息。
多视角的关键在于:正位片直接学习基础 Prompt ;侧位片的 Prompt 不独立训练,而是由线性 Prompt-Aligner 生成:
对双视角可把它直观写成:
这不是让两个视角使用同一个 Prompt,而是让侧位 Prompt 从同一个基础语义出发,学习适合侧位片的变换。之后两路输入分别通过冻结的视觉编码器:
第二步:共同 Adapter 与私有 Adapter 如何分工
这一部分容易被误解。双视角时并非只有“两个 Adapter”,而是有:
1 个 ComAdapter:正位与侧位共用同一组参数
2 个 PriAdapter:正位一套,侧位一套
论文说明 Adapter 遵循 CLIP-Adapter 的两层网络思路。其最基本的形式是先降维、经过非线性、再升维:
其中:
也就是一个小型的 MLP。正文没有公开瓶颈维度 、激活函数、残差连接形式等超参数;这些必须以作者代码或补充材料为准。
共同 Adapter:同一套参数看两个视角
正位和侧位调用的是完全相同的 ComAdapter:
它没有把两张图取平均,也没有在 Adapter 内计算 对 的注意力。共享参数才是它的跨视角约束:同一套小网络需要同时服务两种视角,因此会倾向学习跨视角都稳定、对诊断有用的模式。
私有 Adapter:不同视角各有一套参数
对于正位和侧位:
正位片可学习前后投影中有用的局部证据;侧位片可学习侧向投影中有用的补充证据。它们不共享参数,避免模型强迫两种视角以相同方式表达差异。
这里的“解耦”来自共享/不共享的结构分工与不同的后续路径。论文没有增加显式的正交损失或相似性损失,例如 ;因此它不是数学上严格保证完全分离的解耦。
第三步:私有图像信息为什么要去增强文本
共同图像特征直接用于分类:
私有图像特征不与共同特征直接拼接。作者先用 RepreNet 把它映射到文本侧:
文本编码器先将固定模板编码为类别文本表示 。再添加一个可学习的共同文本表示 ,以及当前视角的私有文本表示:
直观地说,“肺炎”不再只是一个静态文字标签。对于正位和侧位,模型会得到带有不同视角补充信息的疾病参照,再和该视角的图像特征比较。
第四步:不拼接特征,而是融合两个视角的判断
第 个视角对类别 的判断分数是图文余弦相似度:
双视角的最终类别分数采用加权平均:
论文实验中使用 ,即两个视角等权。最终分数经 softmax 变为类别概率,并用交叉熵训练:
这是一种轻量的晚期融合。与跨视角 Transformer 相比,它不显式学习“正位某个 patch 对应侧位哪个 patch”,但参数和计算成本都更低。
训练时哪些参数会更新
一次前向与反向传播可以概括为:
正位片 -> P1 -> 冻结 CLIP -> ComAdapter / PriAdapter1
侧位片 -> P2 = ProAligner(P1) -> 冻结 CLIP -> ComAdapter / PriAdapter2
共同图像特征 + 增强后的视角文本特征 -> 两个视角的类别分数
两个分数加权 -> 交叉熵损失 -> 反向传播
可训练部分包括基础 Prompt、Prompt-Aligner、共同/私有 Adapter、共同文本表示、RepreNet 与 MLP。冻结的是 CLIP 的图像和文本编码器。
冻结不代表梯度无法穿过 CLIP。CLIP 的内部权重不更新,但损失仍能对 Prompt 和 Adapter 求导:
共同 Adapter 会同时收到正位和侧位的梯度;两个私有 Adapter 分别主要从各自视角的文本增强路径收到梯度。论文实验使用 SGD、学习率 、batch size 64。
实验:多视角、各模块与参数效率是否真的有用

主结果
作者在 CheXpert 的 13 个任务上比较传统多视角网络、CLIP 迁移方法和预训练多视角方法。各方法在五种不确定标签处理情形下的 AUC-ROC 取平均:

这组结果的实验协议很重要:CheXpert 标签包含阳性、阴性、不确定和未知。作者没有只选一种不确定标签处理方式,而是分别使用 U-Ignore、U-Zeros、U-Ones、U-SelfTrained 与 U-MultiClass 五种设置,再将每个方法在 13 个疾病任务上的 AUC-ROC 做平均。骨干统一为 ViT-B/32;除非另有说明,使用 SGD、学习率 、weight decay 、batch size 64,两个视角的分数权重为 ,训练硬件为两张 RTX 4090。
| 方法 | 平均 AUC-ROC | 可训练参数 |
|---|---|---|
| DualNet | 0.738 | 47.02M |
| MVC-NET | 0.735 | 71.10M |
| CVT | 0.767 | 23.67M |
| MV-HFMD | 0.775 | 36.05M |
| MCD-CLIP | 0.786 | 2.05M |
MCD-CLIP 的平均成绩最高,但不是每一个疾病类别都第一。例如水肿任务中 MV-HFMD 为 0.854,MCD-CLIP 为 0.843。这张表支持“总体平均表现和参数效率较好”,不能支持“所有疾病任务都最佳”。
逐任务看:优势来自哪里,边界又在哪里
下表从论文 Table 1 摘出 MCD-CLIP、最强多视角对手 MV-HFMD,以及该任务所有方法中的最佳值。粗体表示 MCD-CLIP 达到该行最高值;- 表示该行最优由其他方法获得。
| CheXpert 任务 | MCD-CLIP | MV-HFMD | 全部方法最优 | 判断 |
|---|---|---|---|---|
| Atelectasis | 0.759 | 0.745 | 0.759 | MCD-CLIP 最优 |
| Cardiomegaly | 0.872 | 0.871 | 0.884 (DualNet) | 接近最优,但非最佳 |
| Consolidation | 0.825 | 0.821 | 0.825 | MCD-CLIP 最优 |
| Edema | 0.843 | 0.854 | 0.854 (MV-HFMD) | 不占优 |
| Enlarged Cardiomediastinum | 0.776 | 0.766 | 0.776 | MCD-CLIP 最优 |
| Fracture | 0.765 | 0.745 | 0.765 | MCD-CLIP 最优 |
| Lung Lesion | 0.700 | 0.693 | 0.713 (CoOp) | 不占优 |
| Lung Opacity | 0.746 | 0.722 | 0.746 | MCD-CLIP 最优 |
| Pleural Effusion | 0.923 | 0.921 | 0.923 | MCD-CLIP 最优 |
| Pleural Other | 0.773 | 0.751 | 0.773 | MCD-CLIP 最优 |
| Pneumonia | 0.723 | 0.704 | 0.723 | MCD-CLIP 最优 |
| Pneumothorax | 0.810 | 0.810 | 0.810 | 与 MV-HFMD 并列最优 |
| Support Devices | 0.700 | 0.676 | 0.702 (CVT) | 接近最优,但非最佳 |
也就是说,MCD-CLIP 在 13 项中单独最优 8 项、并列最优 1 项;但心脏增大、肺水肿、肺病灶和支持设备四项并不领先。这比只报 0.786 更完整:方法的平均优势主要来自多类肺部异常与胸腔积液等任务上的稳定提升,而不是所有病种都压倒性领先。
参数效率:不是“模型更小”,而是“更新更少”
论文 Table 2 统计的是可训练参数,不是 CLIP 冻结骨干的完整参数量。MCD-CLIP 的 2.05M 与 MV-HFMD 的 36.05M 相比,少更新 34.00M 个参数,按
计算得到。因而正确的结论是:在作者的 CheXpert 协议下,它以较少的可更新参数取得了较高平均 AUC;这不能直接等价为端到端推理速度一定更快,也不能说明显存、吞吐或训练时间都减少了相同比例,论文并未报告这些指标。
消融:各模块是否有贡献
Figure 2 左图中:
B:每个视角独立学习视觉 Prompt;B+A:加入 Prompt Alignment;B+D:加入表征解耦和文本表示增强;B+A+D:完整 MCD-CLIP。
绿色 B+A+D 在五种设置中都最高。论文报告:Prompt Alignment 相对基线提升 20.77%,表征解耦与文本增强的组合相对基线提升 21.10%,完整模型相对基线提升 26.57%。这些百分比是作者给出的相对基线变化,不是“增加了 20.77 个 AUC 点”;Figure 2 只给出柱状图,没有列出每根柱的精确原始数值,因此不应从图上臆造小数点后三位的结果。不过,论文没有将“表征解耦”与“文本增强”完全拆开单独消融,因此不能据此精确分配两者各自的收益。
多视角是否值得
Figure 2 右图将仅正位、仅侧位和双视角并列。双视角在所有五种标签处理设置中最高。作者报告双视角相较仅正位提升 5.22%,相较仅侧位提升 6.22%。这说明侧位片不必独立强于正位片,但它提供的补充信息能提高联合判断。
与常规 CLIP 和复杂多视角方法的差异
| 维度 | 原始 CLIP | 常规 Prompt/Adapter CLIP | CVT、MV-HFMD 等多视角方法 | MCD-CLIP |
|---|---|---|---|---|
| 默认输入 | 单图 | 多为单图 | 多视角 | 多视角胸片 |
| 视觉 Prompt | 无 | 可能有 | 不是核心 | 多视角对齐 |
| 共同/私有信息 | 无 | 通常无 | 以融合模块学习 | 共享/私有 Adapter 显式分工 |
| 视角融合 | 无 | 通常无 | 中间层/特征层交互 | 图文分数加权 |
| 训练成本 | 零样本或全量微调 | 轻量 | 相对较高 | 轻量 |
所以,本文的创新不在于发明两层 Adapter,也不在于首次使用 Prompt。其核心是把已有轻量组件组合成一个面向多视角胸片的结构:先对齐 Prompt,再将特征按共享与私有路径处理,最后把私有视觉线索用于修正文本类别表示。
局限与适用边界
- 论文主要在 CheXpert 双视角胸片上评估,不能直接推断其对 CT、MRI 或任意数量视角都同样有效。
- 共同/私有分离是由结构与分类目标诱导的,没有显式的解耦约束;是否真正学到了可解释的“共同病灶”和“私有病灶”,仍需要更直接的可视化或定量验证。
- 融合发生在每视角图文相似度之后,计算轻量,但不显式建模跨视角的局部区域对应关系。
- 论文正文未公开 Prompt 数量、Adapter 瓶颈维度、激活函数与残差形式等实现细节;复现实验应以作者公开代码和配置为准。
总结
MCD-CLIP 将多视角诊断拆成一个容易理解的分工:共同 Adapter 负责“两个视角都说明了什么”,私有 Adapter 负责“这个视角额外看到了什么”,而 Prompt Alignment 则让两条视角分支从相关的医学视觉语义出发。
它没有试图用一个更大的融合网络取代 CLIP,而是在冻结 CLIP 的前提下,用小模块把双视角信息组织起来。论文的实验结果说明,这种轻量设计在 CheXpert 的设定中取得了较好的平均诊断性能和参数效率。
参考资料
See also
- MedCLIPSeg:用概率化视觉语言融合做更可靠的医学图像分割 2026-08-05
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割 2026-07-26
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23