DSC:让 U 型网络的跳跃连接在测试时适配医学图像

Date 2026-07-23 · Category tech · Status finished · Confidence likely
论文解读, 医学影像, 图像分割

论文信息

论文:Enhancing feature fusion of U-like networks with dynamic skip connections

期刊:Medical Image Analysis 110 (2026), 104010

链接:DOI官方代码

这篇论文聚焦医学图像分割中的一个常被忽略的位置:skip connection。传统 U-Net 的跳跃连接负责把编码器的高分辨率细节送往解码器,但其传输规则在训练结束后基本固定。作者提出 Dynamic Skip Connection(DSC),试图让这条特征通道针对当前测试样本同时完成尺度选择和测试时适配。


问题不在 U-Net 有没有跳跃连接,而在跳跃连接是否足够灵活

U-Net 的编码器逐层压缩空间分辨率,获得更抽象的语义;解码器再逐层上采样恢复分割掩码。跳跃连接将编码器的细节特征直接交给对应解码器层,使细小边界不至于在下采样中彻底消失。

传统写法可以概括为:

其中, 是第 层编码器特征, 是解码器已有特征。最常见的融合方式是拼接或相加。

在医学影像里,这种固定通路会遇到两类问题:

  • 跨特征约束(inter-feature constraint):同一套编码器到解码器的特征传输规则,要面对不同患者、病灶、扫描协议、对比度和伪影。测试样本偏离训练分布时,解码器未必知道应当保留还是抑制哪些浅层细节。
  • 特征内部约束(intra-feature constraint):跳跃连接内部若只采用固定卷积核,就难以同时处理细胞边界、小病灶和大器官轮廓等不同尺度目标。

注意力机制可以让输出权重随输入变化,但其参数在推理时仍然固定。论文想引入的是更强的适配:让跳跃连接中的一小部分状态在当前测试样本上更新。


DSC:在每条“横向桥接线”中插入动态处理

DSC 总体结构与内部模块

上图左侧是整体框架。作者保留了 U 型网络的编码器和解码器,只把原本直接相连的横向跳跃连接替换为 DSC

右侧是单个 DSC:

编码器特征
  -> DMSK:选择并融合合适的感受野
  -> TTT:针对当前测试样本更新小型状态模型
  -> 解码器

整体公式写成:

DMSK 解决“这条跳连应该看多大范围”,TTT 解决“看完后该如何针对这个样本调整传递规则”。


DMSK:先看局部,再带着局部信息看全局

Dynamic Multi-Scale Kernel(DMSK)预置小尺度和大尺度两组候选卷积核。小核偏向边缘、纹理和细小病灶;大核偏向器官形状和长距离上下文。

它先对特征做全局平均池化:

再为小核与大核分别生成选择概率:

训练时通过 argmax + Straight-Through Estimator 选择卷积核。前向过程是离散选择,反向过程仍可近似传播梯度。

选出的核不是简单并联,而是级联:

这表示先提取局部细节 ,再让大尺度卷积在局部特征之上汇聚上下文 。两路结果经过空间注意力、通道注意力和残差连接后,得到增强跳连特征。

这种设计的直觉是:分割大器官时不能只看局部;分割小病灶时也不能先用大范围平滑掉边界。DMSK 希望每个测试样本先决定尺度,再做局部到全局的递归融合。


TTT:测试时不是更新整个 U-Net,而是更新一个小型记忆

TTT 是本文最容易被误读的部分。它不会拿测试图像的人工分割标签继续训练整个网络,而是在当前特征 token 内部构造一个自监督任务,更新跳连中的小模型。

设展平后的第 个 token 为 。它经三条线性投影得到:

论文实现中,TTT 内部函数 是线性模型:

先让当前状态 根据 预测

自监督误差为:

然后仅更新 TTT 状态:

最后用更新后的状态处理

可以把这一过程理解为: 让模型学习当前样本的局部关系, 再从刚更新的状态中读取适配后的特征。它与普通 self-attention 的区别在于,后者使用固定参数直接计算 ;TTT 则在当前样本内部递推更新

TTT 输出还会与一条 SiLU 分支逐元素相乘,再经线性层和 reshape 回到空间特征图。这一分支可以看作对适配后特征的门控。


实验:跨架构有效,但并非处处单调提升

论文在皮损、内窥镜器械、显微细胞、腹部 CT 和腹部 MRI 上测试 DSC,并覆盖 nnU-NetSegResNetUNETRSwinUNETRMedNextU-Mamba 六类骨干。

二维任务上的定性分割结果

图中前两行是显微细胞输入与 MedNext + DSC 的预测,后两行是内窥镜图像输入与 U-Mamba + DSC 的预测。密集细胞的独立边界和细长器械的前景提取,是这类方法最希望改善的场景。

二维任务中,较显著的 Dice 提升包括:

Endoscopy / SegResNet: 0.5820 -> 0.6620
Endoscopy / SwinUNETR: 0.5528 -> 0.6064
Microscopy / U-Mamba:  0.5389 -> 0.6101

三维 CT 中,各个报告骨干均有提升;但三维 MRI 并非完全一致:SwinUNETR0.7565 降至 0.7469SegResNet 也有轻微下降。这意味着 DSC 是有条件的增强模块,而不是保证所有网络、所有模态均提升的通用补丁。


消融实验:哪些设计真正有证据支持

为什么只放在 bottleneck

UNETR 的位置消融显示:

配置 Dice 推理时间
不使用 DSC 0.8499 17.41 ms
仅 bottleneck 0.8580 47.19 ms
所有跳连层 0.8625 641.55 ms

全层部署只带来额外 0.0045 Dice,却把时延提升到 bottleneck-only 的约 13.6 倍。参数量和常规 GFLOPs 增幅不大,但 TTT 包含测试时状态更新,运行延迟会明显上升。瓶颈层是本文给出的实际部署折中。

DMSK 与 TTT 是否互补

腹部 MRI 的 UNETR 消融结果如下:

模块 Dice NSD
无 DSC 0.6867 0.7440
仅 DMSK 0.6943 0.7534
仅 TTT 0.6965 0.7546
DMSK + TTT 0.6971 0.7576

两个模块单独都有小幅收益,组合后最好;内窥镜任务上的组合增益更明显。该证据支持二者职责不同,但 MRI 上组合相对单独 TTT 的增益较小,且论文没有提供显著性检验。

为什么小核和大核要级联

在 ISIC 2017 上,使用小核和大核的组合比只用任一种尺度更好;级联也优于并联:

并联:mIoU 0.7830, Dice 0.8827, NSD 0.6257
级联:mIoU 0.7980, Dice 0.8876, NSD 0.6423

这一结果支持“先局部、后全局”的融合顺序。不过它主要验证了两类尺度及级联方式的价值,尚不足以完全隔离证明动态核选择本身带来的全部贡献。


TTT 到底有没有针对困难样本做更强更新

TTT 权重更新的奇异值谱

作者对权重更新做奇异值分解:

困难样本的首个奇异值更大,说明其状态更新强度更高;两张谱图的后续奇异值都快速衰减,说明更新集中在少数方向,近似低秩,而不是任意改动整个状态矩阵。

这为“样本级适配”提供了直观证据,但图只展示两个样本和三个活跃 head,不能单独建立困难程度与更新强度之间的统计关系。


局限与适用边界

DSC 的设计目标清晰,但实际使用时需要正视以下边界:

  • 测试时延迟是主要成本。 TTT 的状态更新不能被普通参数量或 GFLOPs 完整反映;对实时手术导航等任务,必须先测端到端延迟。
  • 收益与骨干、模态有关。 MRI 上已有个别骨干下降,不能将其宣传为无条件插件。
  • 实验统计仍可加强。 多个表格的基线来自已有工作,部分指标的标准差较大,论文未报告显著性检验。
  • 可视化证据有限。 Fig. 2 展示的是 DSC 模型预测,没有与同列基线和真值完整并排,主要用于直观检查,不替代定量比较。

总结

这篇论文的贡献不是重新设计一个 U-Net 编码器,而是把注意力放到编码器和解码器之间的接口上:

DMSK:选择当前样本需要的局部与全局尺度
TTT:在当前样本内更新小型状态,适配跨层特征传输

实验表明,这一思路在复杂边界、尺度变化和成像条件变化较大的场景中有实际价值;同时也明确显示,测试时适配必须以延迟为代价。对需要鲁棒分割、且能接受一定在线计算成本的医学影像系统,DSC 提供了一种值得尝试的跳跃连接改造方案。


See also