TGC-Net 精读:把 CLIP 轻量地搬进文本引导医学图像分割
论文信息
论文题目:TGC-Net: a structure-aware and semantically-aligned framework for text-guided medical image segmentation
作者:Gaoren Lin、Huangxuan Zhao、Yuan Xiong、Lefei Zhang、Bo Du、Wentao Zhu。
来源:Information Fusion 135 (2026) 104438,2025-12-09 投稿,2026-04-27 录用。武汉大学计算机学院与华中科技大学同济医学院附属同济医院骨科合作完成。
论文地址:Information Fusion,代码承诺开源:GitHub。
先看结论
TGC-Net 回答了一个朴素但重要的问题:能不能不重新发明轮子,把 CLIP 直接用在文本引导的医学图像分割上?
答案是可以,但要把迁移困难拆开看。论文把「CLIP → 医学分割」的域差距形式化为三个互补的鸿沟,这正是标题 Tri-Gap Calibration(三差距校准)的由来:
| 鸿沟 | 表现 | 对策模块 |
|---|---|---|
| 结构鸿沟 | CLIP ViT 空间表征粗糙,缺细粒度边界 | SSE 语义-结构协同编码器 |
| 语义鸿沟 | 临床描述长且术语密集,CLIP 文本编码器不适配 | DATE 域增强文本编码器 |
| 对齐鸿沟 | 自然域图文对齐在医学域不可靠 | VLCM 视觉-语言校准模块 |
关键数字:冻结 CLIP 双编码器,仅训练 10.3M 参数(比 RefSegformer 小 18.9 倍),在 7 个数据集、4 种成像模态(X-ray / CT / 皮肤镜 / MRI)上全面超越重型专用架构——MosMedData+ Dice 81.00(+3.52),QaTa-COV19 90.54,MSD-Spleen 95.92,ACDC 92.34。
一个数据备注:摘要写 MosMed 提升 3.25%,但正文与 Table 1 按 81.00 − 77.48 应为 3.52%,两处不一致,引用时需留意。
背景:现有方法的困境
医学图像分割依赖昂贵的像素级专家标注,而临床报告在 routine 工作中天然存在。文本引导的医学图像分割就是让模型读报告、分割影像,同时提升精度和可解释性。
主流方法(LViT 等)采用双编码器范式:视觉主干和文本编码器独立训练,再用堆叠的 cross-attention、多阶段融合管线和重型解码器把两个模态焊在一起。问题有三个:交互模块参数量大而医学数据集偏小,过拟合风险高;复杂性的根源在于缺少一个天然对齐的视觉-语言表征空间;文本侧若用独立的 BERT 编码器,则完全浪费了 CLIP 的图文对齐先验。

图 2 给出了直观对比:(a) 典型框架是重型双编码器 + 堆叠跨模态交互 + U 形解码器;(b) 双分支融合用 N 层 cross-attention 对齐视觉特征;(c) TGC-Net 直接站在「预对齐」的 CLIP 之上,只加轻量的三个模块——从「学对齐」变成「校准对齐」。
动机验证:直接用 CLIP 到底差在哪

图 1(a) 是全文最有说服力的证据:文本提示与图像 patch 的相似度图(cost volume 可视化)里,标准 CLIP 与微调 CLIP(第 2-3 列)响应噪声严重、与病灶边界错位;TGC-Net(第 4 列)得到「净化」的相似度图,精准高亮感染区域,与 GT(第 5 列)高度吻合。注意微调 CLIP 也不行,说明问题不能靠简单微调解决,必须结构性修补。
图 1(b) 的参数量-mDice 散点图则预告了全文最硬的卖点:TGC-Net(红色星标)位于左上角帕累托最优位置——参数最少、精度最高。
总体架构:一条渐进式适配流水线

三个模块不是三个独立插件,而是一条渐进式适配流水线:
图像 (336×336 / 768×768) 临床描述 + LLM 辅助提示
│ │
▼ ▼
SSE 结构增强 DATE 语义适配
│ F_V │ F_T
└──────────── VLCM 跨模态校准 ─────┘
│ F'_V, F'_T
▼
Cost Volume 计算
│
▼
CAT-Seg 代价聚合解码器 → 掩码
关键取舍:CLIP 图像编码器与文本编码器全程冻结,保留预训练图文先验、防止小数据集上过拟合,只训练 SSE / DATE / VLCM 和解码器。消融实验会证明全量微调 ViT 反而在小数据集上掉点。
SSE:语义-结构协同编码器

SSE 是双分支设计:上分支为冻结的 CLIP ViT-L(输入 336×336),输出高层语义特征;下分支为轻量 CNN(输入 768×768),提取 1/8、1/16、1/32 多尺度结构特征;经 Add & Norm 融合后送入 MSDeformAttn 多尺度可变形注意力对齐。
融合不是简单相加
对应论文公式 (1):
很多人第一反应是「这不就是直接相加吗」。不是——+ 的两侧各有一个线性投影,相加之后还要过 LayerNorm,而且融合只发生在最深的 1/32 层,1/8 和 1/16 两层完全不碰 CLIP 特征。展开说:
为什么必须先投影? CLIP ViT-L/14 输出的不是空间特征图,而是 577 个 token(576 个 patch + 1 个 CLS,每个 1024 维);CNN 输出的是 C 通道的常规特征图。P_V 把 CLIP 特征投影到 C 维并重排成 24×24 的空间图(CLS token 丢弃),P_C 把 CNN 的 1/32 特征投到同一维度。维度不一致根本没法相加,投影是相加的前提。
双分辨率是设计好的。 CLIP 输入 336×336、patch 14,336 ÷ 14 = 24;CNN 输入 768×768、下采样 32 倍,768 ÷ 32 = 24。两支路在最深层恰好都是 24×24 网格,逐元素相加的空间对齐就是这样埋好的。这也解释了论文为什么用两个不同的输入分辨率。
LayerNorm 不是走形式。 CLIP 特征来自语义嵌入空间、CNN 特征来自结构特征空间,数值分布差异很大;直接相加会让一方淹没另一方。LayerNorm 把混合后的分布拉回稳定尺度,就是 Transformer 里 Add & Norm 的标准思路。
为什么只融合 1/32? 1/32 是语义最浓缩的层,和 CLIP 的全局语义同频;而 1/8、1/16 承担边界和小病灶的细节职责,混入 CLIP 粗粒度的语义反而会稀释结构信息。它们保持纯 CNN,和融合后的 1/32 一起组成混合金字塔 ,整体送入 MSDeformAttn。
MSDeformAttn:加完之后的跨尺度精修
MSDeformAttn 出自 Deformable DETR(Zhu et al., ICLR 2021),后来被 Mask2Former、CAT-Seg 等一批分割模型采用。名字里两个关键词拆开看:
Deformable(可变形)——采样位置是学出来的。 标准 attention 里,一个 query 要和全部 N 个位置算相似度,复杂度 O(N²)。可变形 attention 反过来:每个 query 通过一个轻量线性层,直接回归出 K 个采样点的位置偏移 Δp 和对应的注意力权重 A(典型 K=4),只在这 4 个点上用双线性插值取特征、加权求和:
偏移和权重都是端到端学的——网络自己决定「该看哪里」。
Multi-Scale(多尺度)——4 个点可以落在不同层。 query 在 L₂ 层,但 4 个采样点可以分散在 L₁(细层)、L₂、L₃(粗层):粗层给全局语义,细层给边界细节。代价只有 O(N·K),每个位置 4 次采样。
回到 SSE 的上下文就清楚了:前一步相加是逐像素的机械拼接——CLIP 的语义和 CNN 的结构叠在一起了,但两者还没协调。MSDeformAttn 在混合金字塔上运行,让每个位置自己决定去哪个尺度、哪个位置提取有用信息:病灶中心从 1/32 拿语义判断「这是什么」,边缘位置从 1/8 拿高分辨率细节校准边界。消融里 SSE 单独就带来最大涨幅(+1.35 / +2.64),这个精修环节功不可没。
一句话串联:SSE 负责「把两种特征加到一起」(投影对齐 + 相加 + LN,只在 1/32 层),MSDeformAttn 负责「加完之后再跨尺度地精修融合」——前者是拼接,后者是协调。
DATE:域增强文本编码器

临床描述信息量大但「不好读」——直接简化会丢临床细节,直接喂长句又超出 CLIP 文本编码器的舒适区。DATE 的答案是语义保持的凝练:双提示互补,而不是二选一。
- 主提示 T_p:原始临床描述,保留疾病与位置的显式细节;
- 辅助提示 T_a:由大语言模型(DeepSeek-V3)自动生成的简洁、语义聚焦的同义改写。
论文的例子非常直观。主提示是「Bilateral pulmonary infection, two infected areas, all left lung and lower right lung」(双侧肺部感染,两个感染区,左肺全部 + 右肺下叶——疾病、数量、位置俱全);辅助提示是「CXR with left and right lower focal opacities」(胸片示左右下肺局灶影——短、聚焦、CLIP 友好)。
两条提示经同一个冻结的 CLIP 文本编码器编码,再交叉注意力融合:
巧妙之处在于以「凝练的」辅助特征作为 Query,去查询「详尽的」主特征——相当于让辅助提示引导模型从原始临床描述中挑选最相关的语义成分,既保留任务细节,又获得 CLIP 兼容的紧凑表达。残差连接保证原始语义不丢失。
消融部分有个值得注意的负结果:用通用 LLM 做「扩写」(把文本变长)反而引入冗余、稀释焦点,三个文本策略里垫底。这为「LLM 在医学分割中的正确用法是压缩而非扩写」提供了证据。
VLCM:视觉-语言校准模块

标准 cross-attention 让两个模态的原始特征直接交互,噪声也随之流动。VLCM 改用生成式门控策略,先提炼再交互:
门控网络 G(·) 从视觉与文本特征中共同蒸馏信息量最大的语义线索、抑制噪声,生成统一上下文 F_ctx——它相当于一个域自适应锚点,封装了图文之间的高层语义共识。随后两条对称的交叉注意力支路中,原始模态特征做 Query(保持自身结构/语义特性),共享上下文做 K/V(提供对齐后的引导)。消融显示这个门控设计优于单向和普通双向交叉注意力。
输出的 F'_V、F'_T 被显式对齐到统一医学语义空间,交给 CAT-Seg 式的代价聚合解码器:直接在像素-文本相似度代价空间(而非高维特征空间)操作,最大化利用 VLM 的固有对齐性质。
实验:四个战场全面领先
胸部数据集
| 方法 | 文本 | QaTa Dice | QaTa mIoU | MosMed Dice | MosMed mIoU |
|---|---|---|---|---|---|
| U-Net | × | 79.02 | 69.46 | 64.60 | 50.73 |
| nnUNet | × | 80.42 | 70.81 | 72.59 | 60.36 |
| GLoRIA | ✓ | 79.94 | 70.68 | 72.42 | 60.18 |
| LViT | ✓ | 83.66 | 75.11 | 74.57 | 61.33 |
| Ariadne's Thread | ✓ | 89.78 | 81.45 | 77.75 | 63.60 |
| RecLMIS | ✓ | 85.22 | 77.00 | 77.48 | 65.07 |
| TGC-Net(本文) | ✓ | 90.54 | 82.71 | 81.00 | 68.02 |
QaTa 上较此前最优的 Ariadne's Thread 绝对提升 +0.76 Dice / +1.26 mIoU;MosMed 上较 RecLMIS 提升 +3.52 Dice / +2.95 mIoU。注意文本引导方法(✓)整体优于纯视觉方法(×),印证了文本先验的价值。
腹部 CT 多器官
| 方法 | 提示 | MSD-Spleen | AbdomenCT-1k | WORD |
|---|---|---|---|---|
| MedSAM-2 | 几何 | 86.29 | 86.76 | 77.42 |
| CT-SAM3D | 几何 | 91.83 | 90.05 | 80.33 |
| CAT | 解剖 | 94.26 | 88.38 | 83.53 |
| ZePT | 文本 | 94.03 | 91.34 | 84.26 |
| CRiSP-SAM2 | 文本 | 95.33 | 92.28 | 85.47 |
| TGC-Net(本文) | 文本 | 95.92 | 93.53 | 85.94 |
三个腹部数据集全面超越前 SOTA CRiSP-SAM2(+0.59 / +1.25 / +0.47),且无需任何几何或解剖提示。
皮肤镜与心脏 MRI
ACDC 上 92.34(nnUNet 91.54,RecLMIS 91.53);ISIC 2018 上 91.90(U-Net++ 91.73)。证明框架在 CT/X-ray 之外同样有效。
定性对比

图 4(前三行 MosMedData+,后三行 QaTa-COV19)里,U-Net 等纯视觉方法掩码粗糙不完整;LViT、Ariadne's Thread 改善了语境理解但边界仍欠精细;RecLMIS 边缘更细但在困难条件下会出现虚假区域;TGC-Net 的掩码空间连贯且解剖结构忠实于 GT。
消融:每个模块都在干活,且互补
以「三模块全无」为基线(88.22 / 76.79),单模块加入均有效,其中 SSE 单独贡献最大(89.57 / 79.43),说明结构增强对医学分割是第一优先级。从完整模型中任去一个模块都掉点——三者互补,缺一不可。
SSE 设计消融里有两个值得注意的信号:全量微调 ViT 在 QaTa 上微升(90.19)但在 MosMed 上反而掉到 78.51——过度适配会破坏预训练的跨模态对齐,尤在小而噪的数据集上;复刻 SSE 结构但不冻结 CLIP(90.15 / 80.00)仍不如最终设计,说明冻结带来的先验保持是净收益。

图 5 把抽象的「鸿沟弥合」翻译成了肉眼可见的特征图变化:原始 CLIP 的 patch 特征强度图空间散落、噪声明显;(c) SSE 增强后响应集中于病灶相关区域;(d) VLCM 校准前的图文相似度图仍有干扰响应;(e) 校准后干净且聚焦目标区域。

图 6 在相对复杂的临床描述下,主文本 + LLM 辅助文本联合预测的掩码 (c) 与 GT 明显更一致——辅助提示提供了更聚焦的语义引导。
VLCM 对齐策略消融同样有信息量:无显式对齐基线 89.95 / 79.62,单向交叉注意力 90.25 / 80.03,双向 90.39 / 80.11,门控全局对齐 90.54 / 81.00。仅提供好的视觉/文本特征还不够——显式校准是解决域内对齐鸿沟的必要步骤。
参数效率:10.3M 打全场

TGC-Net 仅 10.3M,显著低于 U-Net(31.0M)、LViT(39.9M)、Ariadne's Thread(44.0M)、RecLMIS(69.4M)、LAVT(118.6M)与 RefSegformer(195.0M)——比 RefSegformer 小 18.9 倍。
效率来源很直接:不联合优化庞大的视觉/文本主干,而是冻结 CLIP 双编码器,只更新轻量任务模块。需要强调(论文自己也声明了):这里的「效率」指任务可训练参数量的优势,而非总参数量或所有场景下的运行时优势——冻结的 CLIP-ViT-L 本身仍在推理链路上,且双分辨率输入(336 + 768)会带来额外计算开销。
局限与总结
论文自述三点局限:冻结的 CLIP 未在医学影像上预训练,封顶了域对齐程度;双分辨率设计以计算成本换结构保真;超声、病理切片等重要模态尚未系统验证。
从精读视角,这篇论文最大的亮点是问题形式化:把「CLIP 迁移难」拆解为结构/语义/对齐三个正交鸿沟,再让每个模块精确对应一个鸿沟——故事完整、消融可验证,这种「问题拆解 → 模块映射 → 逐项验证」的写作范式非常值得借鉴。与相关工作的差异定位也清晰:CAT 只补语义、RecLMIS 只补对齐,TGC-Net 是第一个同时系统处理三者的框架(站在 CLIP 预对齐空间上)。加上 LLM「压缩」优于「扩写」的负结果证据,对数据稀缺、标注昂贵的医学 AI 场景,这条「轻量适配预训练 VLM」的路线具有很强的现实意义。
See also
- VAST 精读:CLIP 持续学习里,视觉分支为什么忘得比文本快 2026-09-11
- StyCona 精读:SVD 把域偏移拆成风格与内容,数据增强各打各的 2026-09-04
- PHFNet 精读:全阶段并行 CNN–Transformer,线性注意力里把弱红外目标补回来 2026-09-03
- GLCNet 精读:小波打散相干斑,全局-局部协作做真实 SAR 去斑 2026-09-02
- DCRM-ViT 精读:冻结骨干,按样本现调参数的多域视觉 Transformer 2026-08-28