MFAINet:把多感受野和注意力真正融合到息肉分割里
论文信息
论文题目:MFAINet: Multi-Receptive Field Feature Fusion With Attention-Integrated for Polyp Segmentation
这篇论文讨论的是息肉分割。作者想解决的核心问题很明确:息肉往往边界模糊、大小不一、形状不规则,而且内窥镜图像里背景干扰很多,单纯依赖局部纹理或者简单多尺度融合,通常都不够稳。
动机:为什么要把多感受野和注意力重新设计

图 1 展示了息肉分割里的几个典型难点:边界模糊、背景干扰、尺度变化大、形状不规则、以及“没有明显凸起”的隐蔽目标。对于这类任务,模型既要看清局部细节,又要理解更大范围的上下文。
作者认为,现有方法虽然经常把多感受野特征提取和注意力机制一起用,但大多是“先多尺度提特征,再交给注意力过滤”的后融合思路。问题在于:
- 多感受野提取如果依赖空洞卷积或池化,容易损失细节。
- 后续注意力如果权重不准,可能把本来有效的信息再次压掉。

图 2 的重点就在这里。左边是常见的后融合方式,右边是作者提出的 in-fusion 方案。论文真正想做的是:不要把多感受野和注意力当成两个独立步骤,而要让它们在特征融合内部就开始协同。
换句话说,这篇论文的动机不是单纯“再做一个更大的网络”,而是尝试回答一个更具体的问题:
如何让多感受野特征提取和注意力机制互相补强,而不是简单串联后彼此削弱?
方法概览

MFAINet 的结构可以概括为三步:
Transformer encoder提取四层特征T1~T4。MPF先把不同层的信息逐步融合,得到更丰富的M1~M3。AMFE在多感受野特征提取的同时嵌入注意力机制,生成A1~A4。SFM再把这些高层特征做双路径融合,输出最终分割结果。
这套设计的思路很像先“补信息”,再“挑信息”,最后“整信息”。
MPF:逐层补上下文

MPF 的作用是把深层语义逐步传到浅层。作者不是直接拿单层特征去做后续处理,而是让 T4 先和 T3 融合,再扩展到 T2,最后汇聚到 T1。
这样做的好处是:
- 浅层特征不会只剩局部纹理;
- 深层特征不会只保留抽象语义;
- 每一层都能拿到更完整的上下文。
这一步的直觉很好理解:息肉分割不是只看“哪里像息肉”,还要看“这个区域放在整张图里合不合理”。
AMFE:多感受野和注意力一起做

AMFE 是论文最核心的创新。它先用不同大小的卷积核提取多感受野特征:
- 小卷积核偏向局部边缘和细节;
- 大卷积核偏向全局上下文和整体形态。
然后作者把局部特征 FL 和全局特征 FG 分开建模,再通过通道注意力和空间注意力生成权重图 S,最后同时作用到 FL 和 FG 上。
这个设计的关键在于,它不是让注意力只过滤一次,而是让注意力参与特征融合本身。这样一来,局部边界和全局语义就不是互相竞争,而是一起被重加权。
SFM:用两条路径做最终融合

SFM 做的是很务实的收尾工作。它把 A1~A4 分成两条融合路径:
- 一条是逐层相加,更偏语义定位;
- 一条是上采样后拼接,更偏边界细节。
最后再把两条路径的结果合并输出。作者的意思很清楚:分割既要知道目标在哪,也要知道边缘长什么样。
实验结果

论文在 CVC-ClinicDB、Kvasir、ColonDB、CVC-300、ETIS 五个公开数据集上做了比较,并和 16 个方法对比。整体结果可以总结成一句话:
- 在大多数关键指标上,MFAINet 都是最优或接近最优。
- 在更难的数据集上,它的泛化能力也比较强。
比如,CVC-ClinicDB 上它的 mDice=0.947, mIoU=0.903;Kvasir 上是 mDice=0.930, mIoU=0.882;CVC-300 上则拿到了很强的整体表现。ETIS 是更难的数据集,MFAINet 依然表现稳定。

图 8 更像是给实验结论做解释。你能看到经过 MPF -> AMFE -> SFM 后,特征图逐渐从“散、弱、模糊”变成“聚焦、清晰、接近 GT”。这说明它的提升不是偶然的,而是每个模块都在往同一个方向帮忙。
消融实验

消融实验主要验证了三件事:
MPF有效,去掉后性能下降,尤其是在更难的数据集上。AMFE有效,它确实比简单的多尺度或单一注意力更强。P1 + P2的双分支融合是有意义的,不是冗余设计。
论文还进一步做了 AMFE 的拆分实验,比较了空洞卷积、池化、不同注意力替换方案以及只保留局部/全局特征的情况。结论很一致:作者提出的“卷积式多感受野 + 分层加权 + 双注意力”方案更稳。
优点
这篇论文最值得肯定的地方,我觉得有四个。
第一,它的问题定义很清楚。作者不是泛泛而谈“我们也用了多尺度和注意力”,而是明确指出了后融合方案的两个痛点:细节损失和权重不准带来的信息丢失。
第二,它的模块设计是连贯的。MPF 补上下文,AMFE 做融合与筛选,SFM 做最后整合,三者之间逻辑闭环比较完整。
第三,实验和可视化支撑比较充分。不是只报一个分数,而是把主结果、特征图和消融都串起来了,能看出每个模块为什么有用。
第四,它在难数据集上的表现比较稳。对息肉分割来说,这点很重要,因为临床图像里最麻烦的往往不是“清晰大目标”,而是边界差、目标小、背景乱的样本。
局限性
这篇论文也有一些比较现实的限制。
第一,AMFE 和整体框架引入了更多卷积与融合操作,虽然作者给出的推理时间还可以接受,但模型本身并不算轻量。对于对实时性或部署资源很敏感的场景,这会是一个实际约束。
第二,论文的提升主要还是围绕 polyp segmentation 这一单一任务展开,虽然作者还展示了其他医学图像上的可视化,但核心验证仍然集中在息肉数据集上。也就是说,它的通用性有一定迹象,但还不是特别充分。
第三,ETIS 上并不是所有指标都绝对第一,说明方法在极难样本上依旧会遇到边界和背景混淆问题。换句话说,它解决了“多感受野+注意力怎么更好地配合”,但没有把息肉分割这个问题完全攻克。
第四,论文的创新更多是结构融合层面的改进,而不是提出一个全新的表示学习范式。这个方向很实用,但理论上属于“增强型设计”,不是那种能立刻改写任务范式的突破。
小结
MFAINet 的核心价值在于:它没有把多感受野和注意力当成两个简单串联的模块,而是尝试把它们嵌进同一条信息流里,让局部细节、全局语义和权重筛选协同工作。
如果用一句话概括这篇论文,可以写成:
它想解决的不是“要不要多尺度、要不要注意力”,而是“这两者到底该怎么融合才不互相伤害”。
对于做医学图像分割的人来说,这篇文章的启发很实在:当一个任务同时依赖边缘、上下文和小目标时,单纯堆模块不一定有效,更关键的是看信息流怎么设计。
See also
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割 2026-07-26
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23
- TG-HEM:用拓扑困难样本挖掘改进拥挤病理细胞检测 2026-07-22