MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割
论文信息
论文题目:MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentation
论文地址:arXiv:2604.20286
这篇工作关注皮肤病变的像素级分割。输入是一张皮肤镜图像,输出是病灶掩码。它的目标不是单纯提高 Dice,而是在有限计算资源下,同时保留病灶边界细节、利用远距离上下文,并减少跳跃连接带来的背景噪声。
论文为 2026 年 arXiv 预印本。下文中的实验数字均为作者在其统一训练、数据划分和评估协议下报告的结果。
动机:医学分割里的精度、全局感受野与成本矛盾
皮肤病变分割存在几个典型难点:病灶和正常皮肤可能对比度很低,形态与尺度差异大,还会受到毛发遮挡和镜面反光影响。对于早期黑色素瘤,边缘形状和范围的细微变化具有诊断价值,因此只得到大致区域并不够。
传统 U-Net/CNN 的优势是局部纹理和边缘提取,缺点是长距离依赖较弱;Transformer 能建立全局关系,但自注意力通常带来更高的计算与显存成本。视觉 Mamba 以状态空间模型提供线性复杂度的长程建模,但既有 Mamba 分割方法仍可能依赖固定融合策略和普通跳跃连接。
作者将问题归结为三个具体环节:
- 多尺度特征不应固定地融合,而应随输入内容动态选择;
- 局部纹理与全局病灶语义需要在同一特征层内协同;
- 编码器到解码器的跳跃连接应过滤毛发、反光与背景纹理,而非直接传递。

图 1 将平均 IoU、平均 Dice、参数量和 GFLOPs 放在一起比较。论文希望证明的不是某个单项指标最高,而是 MambaLiteUNet 能处于高精度、低复杂度的 Pareto 区域。
方法总览:一个 U-Net,三处针对性改造

网络依旧以 U-Net 为骨架:五级编码器逐步下采样,解码器逐步恢复空间分辨率,通道配置为 {16, 32, 48, 64, 96, 128}。浅层使用普通卷积和 GroupNorm;深层引入 AMF 与 LGFM;每条关键跳跃连接在送入解码器前先经 CGA 筛选。最后,1x1 Conv + sigmoid 输出病灶概率图。
整个信息流可以概括为:
输入图像
-> 浅层卷积:颜色、边缘、纹理
-> 深层 AMF + LGFM:多尺度选择与局部-全局建模
-> CGA 跳跃连接:抑制无关细节
-> 解码器:逐级恢复病灶轮廓
-> 像素级病灶掩码
Mamba Block:把远距离关系压进线性时间扫描
图 2(b) 是全模型反复使用的基础块,来自 VMamba。它将输入 token 分为两条支路:
- 门控支路计算
G = SiLU(KWg); - 上下文支路经过投影、深度卷积、
SS2D和归一化,得到H; - 最后逐元素相乘,
Y = G ⊙ H。
SS2D 沿二维图像的多个方向扫描 token,使一个位置可以聚合较远位置的信息。相对全局 self-attention,作者将其作为获取大感受野而控制复杂度的基础模块。
AMF:四个 Mamba 分支,加两次自适应门控
Adaptive Multi-Branch Mamba Feature Fusion 的输入特征 X 会被沿通道均分为四组 X1 ... X4。每组经过独立的 Mamba 分支,并与缩放残差相加:
其中 α 是初始化为零的可学习标量。随后,四组特征拼接并经深度卷积、逐点卷积和 sigmoid 得到空间门 S,对每个分支重新加权;第二个变换门 T 再次细化,最后与原输入进行残差融合。
AMF 的直觉是:同一张图像里,边缘、内部纹理和长程形状线索的重要性并不相同。四个分支先学习不同的状态空间表示,再由门控决定当前样本应保留哪些分支响应。
LGFM:让局部边缘和全局语义一起工作
Local-Global Feature Mixing 接收 AMF 的中间特征后分成两条路径:
- 局部路径使用
3x3 depthwise convolution提取边缘和纹理; - 全局路径使用 8 头自注意力建立远距离依赖;
- 两者拼接、投影、归一化和非线性变换后,重新回到原通道数。
这并非用 Mamba 完全替代注意力,而是把 Mamba 放在特征筛选和长程状态建模中,并在深层较小的特征图上保留多头注意力。这样做的意图是让模型同时知道“边缘在哪里”和“该区域在整张图中是否属于病灶”。
CGA:跳跃连接不再直接复制浅层特征
普通 U-Net 的 skip connection 能帮助解码器恢复高分辨率轮廓,但也可能传递毛发、反光和背景纹理。Cross-Gated Attention 同时使用编码器特征 x 与解码器特征 g:
- 将两者各自拆分为四组;
- 每组经过 Mamba 和
3x3 depthwise convolution; - 用一侧特征生成的 sigmoid 门控另一侧特征;
- 汇合所有分支并生成注意力掩码
ψ; - 输出经过筛选的编码器特征
x_att = ψ ⊙ x。
因此,CGA 的功能不是普通的通道注意力,而是让编码器细节和当前解码器语义相互约束,再决定哪些 skip 特征应进入后续重建。
实验:精度、边界与复杂度是否同时成立
作者在 ISIC2017、ISIC2018、HAM10000、PH2 四个皮肤镜数据集上比较模型。训练采用 BCE 与 Dice 的组合损失,输入统一为 256x256;报告 IoU、Dice、Accuracy、Sensitivity、Specificity、HD95、参数量和 GFLOPs。
| 数据集 | MambaLiteUNet IoU | MambaLiteUNet Dice | 论文中的相近对比 |
|---|---|---|---|
| ISIC2017 | 85.55 | 92.21 | 比 ULVM-UNet 高 2.50 / 1.47 点 |
| ISIC2018 | 83.60 | 91.07 | 比 ULVM-UNet 高 2.96 / 1.78 点 |
| HAM10000 | 90.77 | 95.16 | 比 LB-UNet 高 1.44 / 0.80 点 |
| PH2 | 88.54 | 93.92 | 比 LB-UNet 高 1.42 / 0.80 点 |
| 四数据集平均 | 87.12 | 93.09 | 比 LB-UNet 高 2.10 / 1.22 点 |
完整模型的复杂度为 0.494M 参数与 0.326 GFLOPs。作为对照,论文表中经典 U-Net 为 7.773M 参数与 13.758 GFLOPs。这支持模型在作者协议下的精度-效率优势,但不直接等价于移动端、不同 GPU 或临床工作流中的真实端到端时延。

作者还设置了更严格的域泛化测试:只用色素痣 NV 训练,在六种未见病变类别上测试。MambaLiteUNet 的平均 IoU 为 77.61%、平均 Dice 为 87.23%,并在六类中的四类取得最好结果。该设置说明模型对类别和外观变化有一定稳健性;但训练与测试仍来自 HAM10000,不能替代跨医院、跨设备的外部验证。

定性结果重点展示低对比度、毛发遮挡和不规则边界场景。图中红圈标出部分基线的漏分割或轮廓偏差;本文方法的预测更接近标注掩码。此类图像说明的是代表性样例,统计结论仍应以重复实验下的表格指标为主。
消融实验:每个设计是否真的有贡献
论文使用多组控制实验检查设计来源。
- 损失函数:在 BCE、Dice、BCE+Dice 三种设置下比较,组合损失在 ISIC2017、ISIC2018、HAM10000 上均取得最优 IoU/Dice。
- 模块组合:从无模块基线开始,分别加入 AMF、LGFM、CGA 及其组合。ISIC2017 基线为
82.45 IoU / 90.38 Dice,完整模型为85.55 / 92.21。 - 分支数:将 AMF/CGA 的分支数设为 1、2、4、8、16。ISIC2018 上,四分支取得最高 Dice
91.07;更多分支未继续提高性能。 - 通道数和输入尺寸:五种通道配置与
224到512的输入大小中,主配置{16, 32, 48, 64, 96, 128}、256x256输入具有最佳 Dice 与较平衡的成本。 - Mamba-off 控制:用 token-MLP 替换 Mamba,同时保留门控原则。完整 Mamba-off 版本在 ISIC2017/2018 为
84.26/91.46与82.66/90.51;启用 Mamba 后提升至85.55/92.21与83.60/91.07。
最后一项很关键:它说明性能并非完全来自“多加门控模块”。在该 token-MLP 对照下,Mamba 状态空间建模本身仍带来额外增益;不过这并不覆盖所有可替代的长程建模机制。
补充材料:论文如何继续验证“边界、迁移与效率”
主文回答的是“在四个皮肤镜基准上是否准确”。补充材料继续追问六件事:边界是否更准、换数据集是否还能工作、换成其他成像模态是否失效、少一半标注会怎样、Mamba 是否真的必要、内部特征和推理成本是否符合方法解释。下面这些实验不应和主实验混为一谈,它们各自验证不同的外推边界。
HD95:Dice 高不等于边界一定准
IoU 和 Dice 衡量预测区域和标注区域的重叠,但它们可能掩盖局部轮廓偏差。补充材料因此报告 HD95,即 95% Hausdorff Distance:它忽略最极端的 5% 点对异常,更聚焦于大多数边界点之间最坏的距离。该指标越低,表示病灶轮廓定位越接近标注。
| 数据集 | MambaLiteUNet HD95(像素,均值 ± 标准差) | 主对比:LB-UNet |
|---|---|---|
| ISIC2017 | 10.73 ± 0.92 | 12.05 ± 1.02 |
| ISIC2018 | 12.94 ± 1.02 | 14.61 ± 1.10 |
| HAM10000 | 8.65 ± 0.62 | 9.72 ± 0.74 |
| PH2 | 9.88 ± 0.90 | 14.70 ± 1.00 |
这组结果与主文的 IoU/Dice 方向一致:模型不只是把病灶面积覆盖得更多,也报告了更低的轮廓误差。尤其 PH2 上,本文模型相较 LB-UNet 的 HD95 低 4.82 像素。不过 HD95 仍来自相同公开数据的离线标注,并不能直接代表皮肤科临床诊断准确率。
跨数据集泛化:训练 ISIC2018,直接测试 PH2
主文的 NV-only 试验依然在 HAM10000 的数据来源内。补充材料采用更直接的跨数据集设置:在 ISIC2018 训练,不做微调,直接在完整 PH2 上测试。结果为:
IoU = 81.71% Dice = 89.93%
Accuracy = 93.19% HD95 = 15.58
论文报告相对 ULVM-UNet,IoU 与 Dice 分别高 0.36、0.21 个百分点,HD95 低 1.49。这个增益小于同分布基准中的增益,但更有价值:训练、设备、病灶外观与测试划分发生变化时,模型仍能保持竞争力。它能证明的是跨公开数据集迁移的初步稳健性,不能证明面对真实医院、不同皮肤类型或采集设备时同样稳定。
跨模态泛化:从皮肤镜扩展到超声与病理
补充材料还将模型训练和评估到两个非皮肤镜任务:
| 数据集与模态 | 主要难点 | 本文 IoU / Dice / HD95 | 文中解释 |
|---|---|---|---|
| BUS,乳腺超声 | 斑点噪声、低对比度、不规则肿块边缘 | 77.68 / 87.44 / 11.55 |
全局上下文与门控有助于抑制噪声 |
| GlaS,结直肠组织病理 | 腺体结构复杂、染色差异大 | 78.63 / 88.04 / 21.62 |
局部纹理与结构语义的融合具有迁移性 |
这两项测试说明 AMF、LGFM、CGA 并非只对皮肤镜颜色纹理有效;作者在这些数据上也报告优于对比模型的 IoU、Dice 和 HD95。需要区分的是:这仍是“在每个目标数据集上重新训练后评估”的跨任务验证,并不是将皮肤镜训练模型零样本迁移到超声或病理。
标注减少:性能如何随训练数据缩减
医学像素级标注昂贵,补充材料在 ISIC2017/2018 上保留测试集不变,将训练集随机缩减为 50%、70%、100%。以下是核心趋势:
| 训练数据比例 | ISIC2017 IoU / Dice / HD95 | ISIC2018 IoU / Dice / HD95 |
|---|---|---|
| 50% | 83.30 / 90.89 / 13.24 | 81.49 / 89.80 / 14.99 |
| 70% | 84.14 / 91.39 / 12.06 | 82.23 / 90.25 / 13.61 |
| 100% | 85.55 / 92.21 / 10.73 | 83.60 / 91.07 / 12.94 |
数据减半后,ISIC2017 Dice 从 92.21 降至 90.89,ISIC2018 从 91.07 降至 89.80;HD95 则对应升高。正确的结论不是“少标注没有影响”,而是性能退化相对平缓,说明模型在这一随机子采样协议下仍能学习可用表示。类别失衡、标注偏差或跨中心小样本问题仍需单独测试。
Mamba-off:把门控结构与状态空间建模拆开
主文的模块消融能说明 AMF、LGFM、CGA 的组合有效,但仍有一个归因问题:提升是否仅来自门控和卷积/注意力结构?补充材料用 token-MLP 替换 Mamba,同时保留近似通道维度与选择性门控原则。
| 设置 | ISIC2017 IoU / Dice | ISIC2018 IoU / Dice |
|---|---|---|
| 完整门控结构,关闭 Mamba | 84.26 / 91.46 | 82.66 / 90.51 |
| 完整 MambaLiteUNet | 85.55 / 92.21 | 83.60 / 91.07 |
| Mamba 带来的差值 | +1.29 / +0.75 | +0.94 / +0.56 |
这项实验把结论缩小到一个更可靠的范围:门控设计自身有效,但在作者选择的 token-MLP 对照下,Mamba 的选择性状态空间动态仍贡献了额外增益。它并不说明 Mamba 必然优于所有 Transformer、卷积或其他 SSM 替代方案,只说明它优于该控制设置。
补充可视化:模块究竟改变了什么

图 5 以“启用模块”和“移除模块”成对展示特征图。作者的阅读方式是:
- 启用
AMF后,响应区域更有结构,说明其自适应分支/门控在重新分配特征容量; - 启用
LGFM后,病灶区域的激活更集中,移除它时响应更弱、更分散,支持局部纹理和全局关系需要共同使用; - 启用
CGA后,轮廓附近的响应更清晰,符合其在 skip connection 上过滤无关细节的定位。
这些图给出的是机制一致性的定性证据,不是独立的性能证明。它们无法替代消融表,但能帮助解释为何三个模块的组合更适合复杂边界。

图 6 展示单个样例沿网络传播时的特征变化。上排从输入到 Encoder1--Encoder5 和 bottleneck:分辨率下降后,激活从局部纹理逐渐转为与病灶范围相关的抽象响应。下排从解码器到输出:较早的解码阶段先恢复粗略病灶位置,靠近输出的阶段再收紧轮廓,最终生成接近真值的掩码。
这个可视化与 U-Net 的层级重建逻辑一致,也能对应本文模块位置:深层的 AMF/LGFM 负责形成语义更强的表示,CGA 提供经筛选的细节,解码器则将两者变回像素级边界。
推理时间与显存:轻量不等于绝对最快
补充材料在 RTX 3090 Ti、batch size 1、256x256 输入下测量单图延迟与峰值 GPU 显存:
| 模型 | 秒/图 | 峰值显存 |
|---|---|---|
| VM-UNet | 0.1718 | 582.5 MB |
| VM-UNet2 | 0.1836 | 613.7 MB |
| LightM-UNet | 0.0194 | 63.6 MB |
| ULVM-UNet | 0.0058 | 17.4 MB |
| MambaLiteUNet | 0.0167 | 54.5 MB |
因此,论文的效率主张应读成:相较重型 Mamba 分割网络,它明显降低了延迟和显存,同时保有较高精度;它不是表中绝对最快或最省内存的方案。若部署约束极严,ULVM-UNet 可能更合适;若能接受约 0.0167 秒/图与 54.5 MB 的成本,MambaLiteUNet 提供的是更偏精度的折中。
局限与适用边界
第一,论文是预印本,结果主要来自公开数据集与作者给出的统一复现协议。基线训练预算、数据处理细节和划分方式会影响比较结果,复现时应先核验这些条件。
第二,域泛化虽然测试了六类未见病变、ISIC2018→PH2 跨数据集迁移,并扩展到 BUS 超声和 GlaS 病理图像,但没有展示多中心、跨设备、前瞻性临床验证。医学影像分割指标不能单独证明临床诊断获益。
第三,MambaLiteUNet 并非最低成本的方案。论文的推理对比中,ULVM-UNet 的单图时延和显存使用更低;MambaLiteUNet 的定位是以适度额外成本换取更高的分割精度,而非追求绝对最快。
第四,LGFM 在深层仍使用多头注意力。模型整体轻量,不代表每个组件都保持严格线性复杂度;在更高输入分辨率或不同硬件上,实际收益仍需独立测量。
小结
MambaLiteUNet 的关键不只是把 Mamba 放进 U-Net,而是围绕三个信息流问题组织模块:AMF 动态选择多分支特征,LGFM 合并局部纹理与全局上下文,CGA 在跳跃连接处过滤不匹配的浅层细节。
在作者报告的四个皮肤镜基准上,这套组合同时改善了 IoU、Dice、HD95 与模型复杂度。对于医学分割模型设计,更直接的启发是:全局建模、特征融合和跳跃连接不应视为独立组件,而应共同服务于边界恢复与噪声抑制。
See also
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23
- TG-HEM:用拓扑困难样本挖掘改进拥挤病理细胞检测 2026-07-22
- AdaRoPE 论文精读:为什么不同注意力头不应该使用相同的旋转和缩放方式 2026-07-20