MFAINet:把多感受野和注意力真正融合到息肉分割里

Date 2026-06-12 · Category tech · Status finished · Confidence likely
论文解读, 医学影像, 图像分割

论文信息

论文题目:MFAINet: Multi-Receptive Field Feature Fusion With Attention-Integrated for Polyp Segmentation

这篇论文讨论的是息肉分割。作者想解决的核心问题很明确:息肉往往边界模糊、大小不一、形状不规则,而且内窥镜图像里背景干扰很多,单纯依赖局部纹理或者简单多尺度融合,通常都不够稳。


动机:为什么要把多感受野和注意力重新设计

息肉分割中的典型挑战

图 1 展示了息肉分割里的几个典型难点:边界模糊、背景干扰、尺度变化大、形状不规则、以及“没有明显凸起”的隐蔽目标。对于这类任务,模型既要看清局部细节,又要理解更大范围的上下文。

作者认为,现有方法虽然经常把多感受野特征提取和注意力机制一起用,但大多是“先多尺度提特征,再交给注意力过滤”的后融合思路。问题在于:

  • 多感受野提取如果依赖空洞卷积或池化,容易损失细节。
  • 后续注意力如果权重不准,可能把本来有效的信息再次压掉。

现有方法与本文方法的融合方式对比

图 2 的重点就在这里。左边是常见的后融合方式,右边是作者提出的 in-fusion 方案。论文真正想做的是:不要把多感受野和注意力当成两个独立步骤,而要让它们在特征融合内部就开始协同。

换句话说,这篇论文的动机不是单纯“再做一个更大的网络”,而是尝试回答一个更具体的问题:

如何让多感受野特征提取和注意力机制互相补强,而不是简单串联后彼此削弱?


方法概览

MFAINet 总体结构

MFAINet 的结构可以概括为三步:

  1. Transformer encoder 提取四层特征 T1~T4
  2. MPF 先把不同层的信息逐步融合,得到更丰富的 M1~M3
  3. AMFE 在多感受野特征提取的同时嵌入注意力机制,生成 A1~A4
  4. SFM 再把这些高层特征做双路径融合,输出最终分割结果。

这套设计的思路很像先“补信息”,再“挑信息”,最后“整信息”。

MPF:逐层补上下文

MPF 模块

MPF 的作用是把深层语义逐步传到浅层。作者不是直接拿单层特征去做后续处理,而是让 T4 先和 T3 融合,再扩展到 T2,最后汇聚到 T1

这样做的好处是:

  • 浅层特征不会只剩局部纹理;
  • 深层特征不会只保留抽象语义;
  • 每一层都能拿到更完整的上下文。

这一步的直觉很好理解:息肉分割不是只看“哪里像息肉”,还要看“这个区域放在整张图里合不合理”。

AMFE:多感受野和注意力一起做

AMFE 模块

AMFE 是论文最核心的创新。它先用不同大小的卷积核提取多感受野特征:

  • 小卷积核偏向局部边缘和细节;
  • 大卷积核偏向全局上下文和整体形态。

然后作者把局部特征 FL 和全局特征 FG 分开建模,再通过通道注意力和空间注意力生成权重图 S,最后同时作用到 FLFG 上。

这个设计的关键在于,它不是让注意力只过滤一次,而是让注意力参与特征融合本身。这样一来,局部边界和全局语义就不是互相竞争,而是一起被重加权。

SFM:用两条路径做最终融合

SFM 模块

SFM 做的是很务实的收尾工作。它把 A1~A4 分成两条融合路径:

  • 一条是逐层相加,更偏语义定位;
  • 一条是上采样后拼接,更偏边界细节。

最后再把两条路径的结果合并输出。作者的意思很清楚:分割既要知道目标在哪,也要知道边缘长什么样。


实验结果

主结果对比表

论文在 CVC-ClinicDB、Kvasir、ColonDB、CVC-300、ETIS 五个公开数据集上做了比较,并和 16 个方法对比。整体结果可以总结成一句话:

  • 在大多数关键指标上,MFAINet 都是最优或接近最优。
  • 在更难的数据集上,它的泛化能力也比较强。

比如,CVC-ClinicDB 上它的 mDice=0.947, mIoU=0.903Kvasir 上是 mDice=0.930, mIoU=0.882CVC-300 上则拿到了很强的整体表现。ETIS 是更难的数据集,MFAINet 依然表现稳定。

特征图可视化

图 8 更像是给实验结论做解释。你能看到经过 MPF -> AMFE -> SFM 后,特征图逐渐从“散、弱、模糊”变成“聚焦、清晰、接近 GT”。这说明它的提升不是偶然的,而是每个模块都在往同一个方向帮忙。


消融实验

消融表

消融实验主要验证了三件事:

  1. MPF 有效,去掉后性能下降,尤其是在更难的数据集上。
  2. AMFE 有效,它确实比简单的多尺度或单一注意力更强。
  3. P1 + P2 的双分支融合是有意义的,不是冗余设计。

论文还进一步做了 AMFE 的拆分实验,比较了空洞卷积、池化、不同注意力替换方案以及只保留局部/全局特征的情况。结论很一致:作者提出的“卷积式多感受野 + 分层加权 + 双注意力”方案更稳。


优点

这篇论文最值得肯定的地方,我觉得有四个。

第一,它的问题定义很清楚。作者不是泛泛而谈“我们也用了多尺度和注意力”,而是明确指出了后融合方案的两个痛点:细节损失和权重不准带来的信息丢失。

第二,它的模块设计是连贯的。MPF 补上下文,AMFE 做融合与筛选,SFM 做最后整合,三者之间逻辑闭环比较完整。

第三,实验和可视化支撑比较充分。不是只报一个分数,而是把主结果、特征图和消融都串起来了,能看出每个模块为什么有用。

第四,它在难数据集上的表现比较稳。对息肉分割来说,这点很重要,因为临床图像里最麻烦的往往不是“清晰大目标”,而是边界差、目标小、背景乱的样本。


局限性

这篇论文也有一些比较现实的限制。

第一,AMFE 和整体框架引入了更多卷积与融合操作,虽然作者给出的推理时间还可以接受,但模型本身并不算轻量。对于对实时性或部署资源很敏感的场景,这会是一个实际约束。

第二,论文的提升主要还是围绕 polyp segmentation 这一单一任务展开,虽然作者还展示了其他医学图像上的可视化,但核心验证仍然集中在息肉数据集上。也就是说,它的通用性有一定迹象,但还不是特别充分。

第三,ETIS 上并不是所有指标都绝对第一,说明方法在极难样本上依旧会遇到边界和背景混淆问题。换句话说,它解决了“多感受野+注意力怎么更好地配合”,但没有把息肉分割这个问题完全攻克。

第四,论文的创新更多是结构融合层面的改进,而不是提出一个全新的表示学习范式。这个方向很实用,但理论上属于“增强型设计”,不是那种能立刻改写任务范式的突破。


小结

MFAINet 的核心价值在于:它没有把多感受野和注意力当成两个简单串联的模块,而是尝试把它们嵌进同一条信息流里,让局部细节、全局语义和权重筛选协同工作。

如果用一句话概括这篇论文,可以写成:

它想解决的不是“要不要多尺度、要不要注意力”,而是“这两者到底该怎么融合才不互相伤害”。

对于做医学图像分割的人来说,这篇文章的启发很实在:当一个任务同时依赖边缘、上下文和小目标时,单纯堆模块不一定有效,更关键的是看信息流怎么设计。


See also