GH-UNet:混合卷积与 ViT,如何把医学分割做得更准也更轻
论文信息
论文题目:GH-UNet: group-wise hybrid convolution-VIT for robust medical image segmentation
论文任务是医学图像分割。输入医学图像,输出病灶、器官或解剖结构的像素级分割结果。作者希望解决一个非常现实的问题:现有方法要么局部边界强但全局建模弱,要么全局建模强但计算成本偏高,临床部署并不友好。
核心动机:为什么还要再做一个 U-Net 变体
医学图像分割的难点不只是类别预测,而是要在复杂边界、低对比度、噪声干扰和个体差异很大的条件下,依然把目标区域准确勾出来。
传统 U-Net 或其他 CNN 结构的优势是局部建模强,擅长提纹理、边缘和浅层细节。但问题也很明显:卷积的感受野和归纳方式决定了它对长距离依赖建模天然有限。遇到复杂解剖结构时,模型可能知道某一小块像什么,却不一定知道它在整体结构里应该落在哪里。
Transformer 或 ViT 正好相反。它们能更自然地看全局关系,对长程依赖建模更强,但参数量、显存和 FLOPs 往往更高,不一定适合高分辨率医学图像,更不一定适合部署场景。
作者想解决的不是“精度不够”这一个问题,而是下面这个三难权衡:
- 如何保住局部边界细节;
- 如何补足全局上下文建模;
- 如何不要把模型做得太大太重。
这也是 GH-UNet 的出发点:在 U-Net 框架中引入卷积与 ViT 的混合编码器,同时用动态门控和多尺度解码改善特征融合,把精度、鲁棒性和效率一起往上推。

上图很能说明作者的目标。横轴是 FLOPs,纵轴是 IoU,点的大小和参数量相关。GH-UNet 落在更靠左上方的位置,表示它不仅分割效果更好,而且计算和参数成本更低。也就是说,这篇论文并不是简单堆模块,而是明确想做一个更高效的强模型。
整体结构:它不是普通的 U-Net 拼装
GH-UNet 的大框架依然是编码器、跳跃连接和解码器,但作者把这三部分都做了针对性改造。

整张图可以按下面这个流程去读:
- 输入图像进入编码器。
- 编码阶段同时使用
Vision Transformer和MSGA block提取特征。 - 编码器与解码器之间的跳跃连接并不是直接传递,而是先经过
GDG做动态筛选。 - 解码器逐层上采样,并继续用
MSGA block做多尺度融合和边界细化。 - 最后输出分割掩码。
对应到功能上,它可以压缩成一句话:
Hybrid Encoder + GDG-Gated Skip Connections + Cascaded MSGA Decoder
也就是:
Hybrid Encoder负责同时抓局部细节和全局依赖;GDG负责筛掉无效或冗余的跳连特征;MSGA Decoder负责恢复分辨率并精修边界。
编码器:卷积和 ViT 分工合作
作者在编码器中的核心判断很直接:
- 浅层特征更需要局部纹理和边缘感知;
- 深层特征更需要全局上下文和长程依赖。
因此 GH-UNet 不是纯 CNN,也不是纯 Transformer,而是让两者同时参与编码:
MSGA block主要负责多尺度卷积特征提取;Vision Transformer负责全局关系建模。
这样做的好处是:
- 不会像纯 CNN 一样只擅长看局部;
- 也不会像纯 ViT 一样在医学图像上付出过高代价。
你可以把它理解成:卷积负责看清,ViT 负责看远。
三个关键模块:MSGA、CSG、GDG
GH-UNet 的主体创新主要集中在这三个模块上。

CSG:先决定看什么、再决定看哪里
CSG 可以理解为 Channel-Spatial Gating。
它内部有两条门控路径:
Channel gatingSpatial gating
通道门控通过全局池化和 1x1 Conv 给每个通道分配权重,回答的是“哪些特征通道更重要”;空间门控通过卷积生成空间权重图,回答的是“图中哪些位置更值得关注”。
这一步在医学图像里尤其有意义,因为很多目标区域很小,背景却很大。如果模型不先做筛选,卷积容易在大量无关区域上浪费表达能力。
所以 CSG 的作用可以概括成:
先筛通道,再筛位置。
MSGA:同时看多个尺度
MSGA 是一个多尺度卷积融合模块。它并行使用多个不同大小的卷积核,例如:
1x15x57x7
每个分支前面都带有 CSG,分支输出再通过 BN + ReLU6 和后续卷积继续融合。
它要解决的问题是:医学图像里的目标尺度变化很大。小病灶需要细粒度感受野,大器官或复杂上下文又需要更大范围的建模。只用单一卷积尺度通常不够。
所以 MSGA 的本质是:
多尺度卷积提特征,再用门控机制保留更有价值的尺度信息。
GDG:为什么它特别重要
GDG 是 Group-wise Dynamic Gating,也是这篇论文最有辨识度的模块。
它的流程可以概括成:
- 先把输入特征按通道分组;
- 每一组分别进行卷积和变换;
- 为每一组生成动态门控权重;
- 用这些权重重新缩放每一组特征,再把它们融合回来。
这和普通的整体通道注意力不一样。普通方法往往对全部通道做统一重标定,而 GDG 会先把通道拆成多个子组,再做细粒度动态加权。
它之所以有效,主要有三个原因:
- 对不同语义子空间的区分更细;
- 更适合医学图像中异质性很强的通道特征;
- 更适合放在 skip connection 上做特征净化。
GH-UNet 把 GDG 放在编码器到解码器的连接处,这一点很关键。普通 U-Net 的跳跃连接通常直接把浅层特征送给解码器,其中可能混有很多冗余纹理、背景噪声和不稳定边缘。GDG 的作用,就是在特征进入解码器前先做一次按组筛选和重加权,让后续解码阶段拿到更干净、更有针对性的特征。
可以直接记这句话:
GDG 的价值不只是“又加了一个注意力模块”,而是它把 skip connection 里的特征做了分组、动态、细粒度的重标定。
采样策略:作者连上采样和下采样都没放过
除了主体结构外,作者还调整了编码器和解码器中的采样方式。
- 下采样使用
HWD,也就是 Haar wavelet downsampling; - 上采样使用
DySample。
作者的判断是,传统 Maxpool 或普通插值容易导致高频细节和边界信息丢失,而医学图像分割最怕的恰恰就是边界模糊。HWD 更强调保留频域信息,DySample 则更强调结构感知的动态恢复。
这部分虽然不是论文标题里的主角,但和前面的 MSGA、GDG 是同一个思路:边界细节不能在采样阶段被白白损失掉。
实验设置:覆盖多个任务,而不是单点刷分
作者在五个公开数据集和一个私有数据集上验证 GH-UNet,覆盖了多种医学分割任务:
ISIC2016:皮肤病灶分割Kvasir-SEG:息肉分割IDRiD:眼底病灶分割ACDC:心脏 MRI 分割Synapse:腹部多器官 CT 分割BT-Seg:私有脑肿瘤分割
对比方法既包括经典 CNN,也包括 Transformer 和 Hybrid 模型,例如:
UNetUNet++DeepLabv3+nnUNetSwin-UNetnnFormerTransUNetCvTEMCADH2Former
评估指标主要有:
DiceIoUAccMAEHD95- 参数量与 FLOPs
这套实验设计的意义在于,它不是只在单一数据集上报告一个“漂亮数字”,而是试图证明模型在不同器官、不同模态、不同难度任务下都具有稳定性。
主实验:它到底证明了什么
主结果可以概括成一句话:GH-UNet 在多个任务上都能取得强性能,同时保留较好的参数效率和计算效率。
作者在摘要中给出的代表性结果是 ISIC2016:
- 相比
H2Former Dice提升1.37%IoU提升1.94%- 参数量只用了对方约
38% - FLOPs 约是对方的
49.61%
这个结果有说服力,因为 H2Former 本身已经是强基线。GH-UNet 并不是靠更大模型压过去,而是在更轻的前提下取得更高性能。
论文在其他任务上的趋势也比较一致:
Kvasir-SEG上对息肉边界定位更强;IDRiD上对小病灶和复杂多类别区域更有优势;ACDC上能适应心脏结构尺度变化;Synapse上在多器官和复杂边界场景下依然稳定;- 私有
BT-Seg上也优于H2Former和nnUNet。
如果只看实验主线,作者其实在证明三件事:
- 这不是一个只在单任务上有效的结构;
- 这不是一个靠堆参数换精度的结构;
- 这不是一个只会提高整体 Dice、却没有边界质量提升的结构。
可视化结果:数字之外,它的边界确实更好
下面这张图展示了私有脑水肿分割任务上的可视化对比。

从左到右分别是:
GTGH-UNetH2FormernnUNet
这张图里 GH-UNet 的特点很明显:
- 边界更接近 GT;
- 小区域保留更完整;
- 细长、弯曲和复杂结构不容易被粗糙块状化;
- 3D 重建视角下也更完整。
这和模型结构形成了比较自然的对应关系:
MSGA帮助同时保留细尺度和大尺度信息;CSG提升了通道与空间选择性;GDG减少跳连噪声;HWD + DySample减少采样带来的边界损失。
因此可视化不是附属展示,而是在补充说明为什么这些模块设计不是纸上谈兵。
消融实验:作者有没有证明这些模块真的有用
消融实验是这篇论文比较扎实的部分。

关键模块消融
左表逐步加入:
PW:预训练权重MSGAGDGCascade
以 ISIC2016 为例,Dice 从基线的 85.32 一路提升到最终的 93.56。中间趋势很稳定:
- 加预训练权重提升明显;
- 加
MSGA后继续显著提升; - 加
GDG仍然带来正向收益; - 全部组合后达到最优。
这说明:
MSGA的多尺度特征提取确实有效;GDG虽然不是单次增幅最大的部分,但它是稳定正收益模块;- 最终性能提升来自模块协同,而不是单点技巧。
采样策略消融
右表比较了不同的上采样和下采样策略。结果显示:
HWD + DySample组合最好;- 优于传统
Maxpool + interpolate。
这能说明作者替换采样方式不是“随手换个模块”,而是确实改善了边界恢复质量。
怎么评价这篇论文
如果从论文阅读角度总结,我会把 GH-UNet 归为一类很典型但做得比较扎实的工作:它不是完全颠覆式的方法,而是在 U-Net 范式内,把编码、特征筛选、多尺度融合和采样策略一起做了系统优化。
它最值得记住的点有三个:
- 用 hybrid convolution-ViT encoder 同时处理局部和全局;
- 用
GDG对 skip connection 做分组动态重加权; - 用
MSGA和更合适的采样策略改善边界恢复。
从实验结果看,作者确实证明了这套设计能在多个任务上稳定工作,而且效率也不错。
当然,这篇论文也不是没有保留意见:
- 相比最强基线,部分任务上的提升属于稳健优化而不是巨大跨越;
- 私有数据集部分天然不如公开数据集可复现;
- 整体结构比原始 U-Net 更复杂,工程实现成本也会更高。
但如果你的目标是理解当前医学图像分割论文中“如何在 U-Net 上做有效增强”,GH-UNet 是一篇值得读的例子。它展示的不是单个炫技模块,而是一整套围绕局部细节、全局依赖和高效部署做出的折中设计。
一句话总结
GH-UNet 想解决的问题不是单纯提高 Dice,而是:
在医学图像分割中,同时保住局部边界、补足全局依赖,并把参数量和计算量控制在更适合部署的范围内。
它给出的答案是:
Hybrid Encoder + MSGA + CSG + GDG + Better Sampling
也就是在 U-Net 框架中,把特征提取、特征筛选和特征恢复这三件事重新做一遍。
See also
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割 2026-07-26
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23
- TG-HEM:用拓扑困难样本挖掘改进拥挤病理细胞检测 2026-07-22