GH-UNet:混合卷积与 ViT,如何把医学分割做得更准也更轻

Date 2026-06-01 · Category tech · Status finished · Confidence likely
论文解读, 医学影像, 图像分割

论文信息

论文题目:GH-UNet: group-wise hybrid convolution-VIT for robust medical image segmentation

论文任务是医学图像分割。输入医学图像,输出病灶、器官或解剖结构的像素级分割结果。作者希望解决一个非常现实的问题:现有方法要么局部边界强但全局建模弱,要么全局建模强但计算成本偏高,临床部署并不友好。


核心动机:为什么还要再做一个 U-Net 变体

医学图像分割的难点不只是类别预测,而是要在复杂边界、低对比度、噪声干扰和个体差异很大的条件下,依然把目标区域准确勾出来。

传统 U-Net 或其他 CNN 结构的优势是局部建模强,擅长提纹理、边缘和浅层细节。但问题也很明显:卷积的感受野和归纳方式决定了它对长距离依赖建模天然有限。遇到复杂解剖结构时,模型可能知道某一小块像什么,却不一定知道它在整体结构里应该落在哪里。

Transformer 或 ViT 正好相反。它们能更自然地看全局关系,对长程依赖建模更强,但参数量、显存和 FLOPs 往往更高,不一定适合高分辨率医学图像,更不一定适合部署场景。

作者想解决的不是“精度不够”这一个问题,而是下面这个三难权衡:

  • 如何保住局部边界细节;
  • 如何补足全局上下文建模;
  • 如何不要把模型做得太大太重。

这也是 GH-UNet 的出发点:在 U-Net 框架中引入卷积与 ViT 的混合编码器,同时用动态门控和多尺度解码改善特征融合,把精度、鲁棒性和效率一起往上推。

GH-UNet 在 ISIC2016 上的性能、参数量和 FLOPs 对比

上图很能说明作者的目标。横轴是 FLOPs,纵轴是 IoU,点的大小和参数量相关。GH-UNet 落在更靠左上方的位置,表示它不仅分割效果更好,而且计算和参数成本更低。也就是说,这篇论文并不是简单堆模块,而是明确想做一个更高效的强模型。


整体结构:它不是普通的 U-Net 拼装

GH-UNet 的大框架依然是编码器、跳跃连接和解码器,但作者把这三部分都做了针对性改造。

GH-UNet 整体结构图

整张图可以按下面这个流程去读:

  1. 输入图像进入编码器。
  2. 编码阶段同时使用 Vision TransformerMSGA block 提取特征。
  3. 编码器与解码器之间的跳跃连接并不是直接传递,而是先经过 GDG 做动态筛选。
  4. 解码器逐层上采样,并继续用 MSGA block 做多尺度融合和边界细化。
  5. 最后输出分割掩码。

对应到功能上,它可以压缩成一句话:

Hybrid Encoder + GDG-Gated Skip Connections + Cascaded MSGA Decoder

也就是:

  • Hybrid Encoder 负责同时抓局部细节和全局依赖;
  • GDG 负责筛掉无效或冗余的跳连特征;
  • MSGA Decoder 负责恢复分辨率并精修边界。

编码器:卷积和 ViT 分工合作

作者在编码器中的核心判断很直接:

  • 浅层特征更需要局部纹理和边缘感知;
  • 深层特征更需要全局上下文和长程依赖。

因此 GH-UNet 不是纯 CNN,也不是纯 Transformer,而是让两者同时参与编码:

  • MSGA block 主要负责多尺度卷积特征提取;
  • Vision Transformer 负责全局关系建模。

这样做的好处是:

  • 不会像纯 CNN 一样只擅长看局部;
  • 也不会像纯 ViT 一样在医学图像上付出过高代价。

你可以把它理解成:卷积负责看清,ViT 负责看远。


三个关键模块:MSGA、CSG、GDG

GH-UNet 的主体创新主要集中在这三个模块上。

MSGA、CSG 与 GDG 模块图

CSG:先决定看什么、再决定看哪里

CSG 可以理解为 Channel-Spatial Gating

它内部有两条门控路径:

  • Channel gating
  • Spatial gating

通道门控通过全局池化和 1x1 Conv 给每个通道分配权重,回答的是“哪些特征通道更重要”;空间门控通过卷积生成空间权重图,回答的是“图中哪些位置更值得关注”。

这一步在医学图像里尤其有意义,因为很多目标区域很小,背景却很大。如果模型不先做筛选,卷积容易在大量无关区域上浪费表达能力。

所以 CSG 的作用可以概括成:

先筛通道,再筛位置。

MSGA:同时看多个尺度

MSGA 是一个多尺度卷积融合模块。它并行使用多个不同大小的卷积核,例如:

  • 1x1
  • 5x5
  • 7x7

每个分支前面都带有 CSG,分支输出再通过 BN + ReLU6 和后续卷积继续融合。

它要解决的问题是:医学图像里的目标尺度变化很大。小病灶需要细粒度感受野,大器官或复杂上下文又需要更大范围的建模。只用单一卷积尺度通常不够。

所以 MSGA 的本质是:

多尺度卷积提特征,再用门控机制保留更有价值的尺度信息。

GDG:为什么它特别重要

GDGGroup-wise Dynamic Gating,也是这篇论文最有辨识度的模块。

它的流程可以概括成:

  1. 先把输入特征按通道分组;
  2. 每一组分别进行卷积和变换;
  3. 为每一组生成动态门控权重;
  4. 用这些权重重新缩放每一组特征,再把它们融合回来。

这和普通的整体通道注意力不一样。普通方法往往对全部通道做统一重标定,而 GDG 会先把通道拆成多个子组,再做细粒度动态加权。

它之所以有效,主要有三个原因:

  • 对不同语义子空间的区分更细;
  • 更适合医学图像中异质性很强的通道特征;
  • 更适合放在 skip connection 上做特征净化。

GH-UNet 把 GDG 放在编码器到解码器的连接处,这一点很关键。普通 U-Net 的跳跃连接通常直接把浅层特征送给解码器,其中可能混有很多冗余纹理、背景噪声和不稳定边缘。GDG 的作用,就是在特征进入解码器前先做一次按组筛选和重加权,让后续解码阶段拿到更干净、更有针对性的特征。

可以直接记这句话:

GDG 的价值不只是“又加了一个注意力模块”,而是它把 skip connection 里的特征做了分组、动态、细粒度的重标定。


采样策略:作者连上采样和下采样都没放过

除了主体结构外,作者还调整了编码器和解码器中的采样方式。

  • 下采样使用 HWD,也就是 Haar wavelet downsampling;
  • 上采样使用 DySample

作者的判断是,传统 Maxpool 或普通插值容易导致高频细节和边界信息丢失,而医学图像分割最怕的恰恰就是边界模糊。HWD 更强调保留频域信息,DySample 则更强调结构感知的动态恢复。

这部分虽然不是论文标题里的主角,但和前面的 MSGA、GDG 是同一个思路:边界细节不能在采样阶段被白白损失掉。


实验设置:覆盖多个任务,而不是单点刷分

作者在五个公开数据集和一个私有数据集上验证 GH-UNet,覆盖了多种医学分割任务:

  • ISIC2016:皮肤病灶分割
  • Kvasir-SEG:息肉分割
  • IDRiD:眼底病灶分割
  • ACDC:心脏 MRI 分割
  • Synapse:腹部多器官 CT 分割
  • BT-Seg:私有脑肿瘤分割

对比方法既包括经典 CNN,也包括 Transformer 和 Hybrid 模型,例如:

  • UNet
  • UNet++
  • DeepLabv3+
  • nnUNet
  • Swin-UNet
  • nnFormer
  • TransUNet
  • CvT
  • EMCAD
  • H2Former

评估指标主要有:

  • Dice
  • IoU
  • Acc
  • MAE
  • HD95
  • 参数量与 FLOPs

这套实验设计的意义在于,它不是只在单一数据集上报告一个“漂亮数字”,而是试图证明模型在不同器官、不同模态、不同难度任务下都具有稳定性。


主实验:它到底证明了什么

主结果可以概括成一句话:GH-UNet 在多个任务上都能取得强性能,同时保留较好的参数效率和计算效率。

作者在摘要中给出的代表性结果是 ISIC2016

  • 相比 H2Former
  • Dice 提升 1.37%
  • IoU 提升 1.94%
  • 参数量只用了对方约 38%
  • FLOPs 约是对方的 49.61%

这个结果有说服力,因为 H2Former 本身已经是强基线。GH-UNet 并不是靠更大模型压过去,而是在更轻的前提下取得更高性能。

论文在其他任务上的趋势也比较一致:

  • Kvasir-SEG 上对息肉边界定位更强;
  • IDRiD 上对小病灶和复杂多类别区域更有优势;
  • ACDC 上能适应心脏结构尺度变化;
  • Synapse 上在多器官和复杂边界场景下依然稳定;
  • 私有 BT-Seg 上也优于 H2FormernnUNet

如果只看实验主线,作者其实在证明三件事:

  • 这不是一个只在单任务上有效的结构;
  • 这不是一个靠堆参数换精度的结构;
  • 这不是一个只会提高整体 Dice、却没有边界质量提升的结构。

可视化结果:数字之外,它的边界确实更好

下面这张图展示了私有脑水肿分割任务上的可视化对比。

脑水肿分割可视化对比

从左到右分别是:

  • GT
  • GH-UNet
  • H2Former
  • nnUNet

这张图里 GH-UNet 的特点很明显:

  • 边界更接近 GT;
  • 小区域保留更完整;
  • 细长、弯曲和复杂结构不容易被粗糙块状化;
  • 3D 重建视角下也更完整。

这和模型结构形成了比较自然的对应关系:

  • MSGA 帮助同时保留细尺度和大尺度信息;
  • CSG 提升了通道与空间选择性;
  • GDG 减少跳连噪声;
  • HWD + DySample 减少采样带来的边界损失。

因此可视化不是附属展示,而是在补充说明为什么这些模块设计不是纸上谈兵。


消融实验:作者有没有证明这些模块真的有用

消融实验是这篇论文比较扎实的部分。

关键模块与采样策略消融实验

关键模块消融

左表逐步加入:

  • PW:预训练权重
  • MSGA
  • GDG
  • Cascade

ISIC2016 为例,Dice 从基线的 85.32 一路提升到最终的 93.56。中间趋势很稳定:

  • 加预训练权重提升明显;
  • MSGA 后继续显著提升;
  • GDG 仍然带来正向收益;
  • 全部组合后达到最优。

这说明:

  • MSGA 的多尺度特征提取确实有效;
  • GDG 虽然不是单次增幅最大的部分,但它是稳定正收益模块;
  • 最终性能提升来自模块协同,而不是单点技巧。

采样策略消融

右表比较了不同的上采样和下采样策略。结果显示:

  • HWD + DySample 组合最好;
  • 优于传统 Maxpool + interpolate

这能说明作者替换采样方式不是“随手换个模块”,而是确实改善了边界恢复质量。


怎么评价这篇论文

如果从论文阅读角度总结,我会把 GH-UNet 归为一类很典型但做得比较扎实的工作:它不是完全颠覆式的方法,而是在 U-Net 范式内,把编码、特征筛选、多尺度融合和采样策略一起做了系统优化。

它最值得记住的点有三个:

  • 用 hybrid convolution-ViT encoder 同时处理局部和全局;
  • GDG 对 skip connection 做分组动态重加权;
  • MSGA 和更合适的采样策略改善边界恢复。

从实验结果看,作者确实证明了这套设计能在多个任务上稳定工作,而且效率也不错。

当然,这篇论文也不是没有保留意见:

  • 相比最强基线,部分任务上的提升属于稳健优化而不是巨大跨越;
  • 私有数据集部分天然不如公开数据集可复现;
  • 整体结构比原始 U-Net 更复杂,工程实现成本也会更高。

但如果你的目标是理解当前医学图像分割论文中“如何在 U-Net 上做有效增强”,GH-UNet 是一篇值得读的例子。它展示的不是单个炫技模块,而是一整套围绕局部细节、全局依赖和高效部署做出的折中设计。


一句话总结

GH-UNet 想解决的问题不是单纯提高 Dice,而是:

在医学图像分割中,同时保住局部边界、补足全局依赖,并把参数量和计算量控制在更适合部署的范围内。

它给出的答案是:

Hybrid Encoder + MSGA + CSG + GDG + Better Sampling

也就是在 U-Net 框架中,把特征提取、特征筛选和特征恢复这三件事重新做一遍。


See also