PHFNet 精读:全阶段并行 CNN–Transformer,线性注意力里把弱红外目标补回来
论文信息
论文题目:PHFNet: A Parallel Hybrid Fusion Network With Linear Attention for Infrared Small Target Detection
作者:Longteng Li、Liang Guo(通讯,IEEE Senior Member)、Xinchen Li、Xinrui Jiang、Xuan Wang、Dan Jing、Kai Wei、Kai Jin、Mengdao Xing(IEEE Fellow)。西安电子科技大学光电工程学院为主,西电杭州研究院、浙江大学光电科学与工程学院、西电 Faculty of Infor-X 合作。
来源:IEEE Transactions on Geoscience and Remote Sensing 64 (2026) Art. no. 5006217。2026-01-07 投稿,04-22 录用,04-27 发表。
论文:DOI: 10.1109/TGRS.2026.3687647。代码标注 will be released:github.com/Llt201/PHFNet(截稿时仓库尚未公开)。任务是单帧红外小目标分割检测(IRSTD),不是检测框。
先看结论
PHFNet 回答的问题很具体:弱红外目标只有几十个像素,现有 CNN–Transformer 混合往往把全局建模推迟到深层或窗口里——目标在下采样中途已经被背景压没,后面再「全局」也救不回来。全阶段并行又撞上 softmax 注意力的 。
做法是把约束写成三句话,再各自做成模块:每一级都要全局;全局必须线性;线性不能把弱目标抹平。
| 组件 | 职责 | 通俗角色 |
|---|---|---|
| 全阶段并行 CNN–Transformer | 每一级同时提局部细节和全局判别 | 放大镜和望远镜从第一层并排看,不等人把火星踩没了再抬头 |
| LCLA = TLA + SMLP | Taylor 线性注意力 + 自适应局部补偿 + 轴向平移交互 | 望远镜加可调局部补偿:让弱目标参与全局加权,但别把云也放大 |
| BMRA | 双向多尺度池化校准 + 空间注意力 | 焊完之后的质检:横竖压背景、抬目标,再修轮廓 |
关键数字(Table I,官方划分重训对比):
| SIRST | NUDT-SIRST | IRSTD-1K | |
|---|---|---|---|
| IoU | 80.12 | 96.70 | 71.39 |
| nIoU | 80.28 | 96.48 | 67.19 |
| Fm | 88.96 | 98.32 | 83.31 |
| Pd | 98.10 | 99.47 | 94.28 |
| Fa (×10⁻⁶) | 11.60 | 4.08 | 17.25 |
三数据集 IoU / nIoU / Fm 全表第一。Pd/Fa 在 SIRST、NUDT-SIRST 最优;IRSTD-1K 上 DNANet 的 Fa 更低(12.41 vs 17.25),但 IoU / nIoU / Fm / Pd 分别低 5.54 / 0.59 / 3.91 / 3.37 个点。AUC 为 85.88 / 96.97 / 83.48。代价:19.52 M、25.83 G、256×256 推理 19 ms(RTX 4090)——不是最轻,比同量级方法准。
一个实验前提:6 个传统方法 + 15 个深度学习方法按官方实现、同一划分重训;SIRST / NUDT-SIRST 用 50% 训练,IRSTD-1K 与扩展集 SIRST-UAVB 用 80%。
背景:小目标死在哪
红外靠热辐射成像,夜视、海监、预警都用。目标弱、小(常少于 100 像素)、和杂波灰度接近。
三条老路各有死法:
- 模型驱动(Top-Hat、局部对比、低秩稀疏):先验一偏就虚警。
- CNN 分割(ACM、DNANet、UIU-Net、IOVarNet):像素定位强,卷积感受野局部,长得像目标的背景分不开。
- CNN–Transformer 混合:一类只在 CNN 编码器里扩感受野;一类把自注意力关在窗口、固定位置或下采样特征上。全局语义不连续。弱响应在早期卷积和反复下采样里就被主导背景压到接近本底,深层再做全局已经晚了。
softmax 注意力是 ,全阶段并行塞不进预算。线性注意力把复杂度降到 ,但全局聚合秩低,响应容易被抹匀——小目标更容易被背景「平均掉」。
设计约束因此是:每一级都要全局、全局必须线性、线性不能把弱目标抹平。
动机图:现有混合为什么碎

图 1 三行是同一类故事。(a) SCTransNet、(b) DWTFreqNet:漏检或虚警,激活碎;(c) PHFNet:更干净、轮廓更贴 GT。论文用这张图支撑「局部提取和全局判别分离」会把弱目标做碎。

图 2:softmax 要算完整 (二次);线性注意力先算 ,对 token 数线性。换来的是效率,失去的是尖锐的注意力分布——后面 LCLA 就是冲着这个缺口去的。
总体架构:每一级都是 CNN ∥ Trans → Fusion

对称 U-Net:5 级编码 + 4 级解码,通道 32→64→128→256→512。编码 MaxPool 下采样,解码转置卷积 / 双线性上采样,skip 是 concat。
每一级的核心块:
Fin
├─ CNN:CBR×3 残差求和 + 1×1 → Fl(局部)
├─ Trans:1×1 对齐通道 → LCLA(TLA + SMLP) → Fg(全局)
└─ Fusion:Fl + Fg → BMRA → Dropout1 + BN + ReLU
训练对所有解码器输出做辅助 mask 监督(BCE,跟 UIU-Net 一路);推理只用最终头。输入先归一化、随机裁 256×256,再复制成 3 通道。超参基本跟 SCTransNet。
CNN 支路(公式 1)不是深堆,是三级渐进再相加:
Table V 验证过:两级不够,四级在 SIRST 上掉点;换成 PConv / IDConv / DWC 也没有稳定超过这套三级。局部支路在这里是「稳」而不是「花」。
LCLA:线性注意力里把局部补回去

图 4:(a) LCLA = TLA + SMLP;(b) TLA 的 Taylor 线性化 + 自适应局部补偿;(c) SMLP 轴向 shift + DWC,用来和 CNN 支路对齐空间。
标准线性注意力像把整张图搅成一锅粥:背景占绝对多数,那几个亮点被平均没了。有人往粥里固定加一勺卷积(静态局部),云和目标一起变浓。LCLA 是:先允许局部进来,再用可学习缩放 限制剂量,再用 GELU 门决定这一口要不要咽。
Softmax 相似度 是 。Taylor:,丢掉高阶余项后(先忽略归一化)变成:
先算 ,复杂度 。正文明确说:丢掉余项会把表示塌成低秩、过匀,弱目标和结构杂波分不开。
投影(公式 6):
Softplus 保证 非负。补偿后的输出(公式 7):
DWC 是 3×3 深度可分卷积; 管幅度;GELU 门做内容自适应。再 1×1 + 残差得到 。单头,避免把头一拆把稀疏弱信号拆碎。
和相关工作的差别:MobileViT 是串行 local→global;Agent Attention 等是静态局部注入。这里是可学习缩放 + 门控,让局部项按输入调节,而不是永远加那么多。
SMLP(仿 UNeXt):BN 后按通道分组,shift-size 做竖移→1×1→DWC+GELU,再横移同样一套,残差回 。作用不是再加一层注意力,而是给 Transformer 支路一点显式空间交互,缩小和 CNN 的表征差。SIRST 上 ,NUDT-SIRST / IRSTD-1K 上 。
BMRA:融合之后再校准

图 5 下排热力图:校准前背景一片亮,校准后背景被压、弱目标更尖。
双支路加完会语义对不齐:CNN 细、Transformer 匀,直接用会畸变轮廓、放大结构杂波。现有混合注意力爱用平均池化,弱目标更容易被抹。
BMRA 的顺序是 先全局校准、再局部增强:
- 沿宽 / 高做自适应 avg pool + max pool(avg 压背景、max 抬显著点);
- avg 支路 1D conv ,max 支路 1D conv (非对称核,Table XI 选的 (3, 5));
- GN + Sigmoid 得到四张方向注意力;
- ;
- 轴向注意力没有完整 2D 相关,再接 SAM 修局部结构。
Table VIII:只留 SAM 或只留 max 池化都不稳(后者 Fa 飙到 34.41);完整 BMRA 在 IRSTD-1K 上 IoU 71.39。Table IX:SIRST IoU 80.12,高于 ECA 75.19、CPCA 78.03、CA / EMA / SCSA。
实验
数据:SIRST、NUDT-SIRST 官方 50% 训练;IRSTD-1K、扩展集 SIRST-UAVB 80%。另在 SIRST 上加高斯噪声 。对比 6 个传统 + 15 个深度学习方法,按官方实现、同一划分重训。
训练:RTX 4090 + i7-14700KF,batch size 8,Dropout1=0.1;SIRST 1000 epoch / Dropout2=0.5;NUDT-SIRST 800 / 0.5;IRSTD-1K 800 / 0.1;UAVB 1500。阈值 0.5。指标:IoU、nIoU、Fm、Pd(质心偏差 3 像素)、Fa。

Table I 是主表。传统方法 IoU 普遍个位数到十几;深度学习过了 70 以后拼的是轮廓和虚警。PHFNet 三套 IoU / nIoU / Fm 全粗体。

ROC 三数据集都压在上面,和 Table II 的 AUC(85.88 / 96.97 / 83.48)一致。

云杂波场景里对比方法容易虚或碎,PHFNet 更干净;(d) 重杂波时论文称只有它既定位又几乎不虚警;IRSTD-1K 暗目标也更稳。定性图作示意,主结论仍以 Table I 为准。

RDIAN 参数最少、推理最快(0.217 M / 3 ms),ACM FLOPs 最低(0.405 G)。PHFNet 19.52 M / 25.83 G / 19 ms,三数据集平均 IoU 82.74、nIoU 81.32。效率叙事是「中等开销换明显更准」,不是轻量 SOTA。
消融

| 变体 | 要点 | IoU | nIoU | Fa |
|---|---|---|---|---|
| (a) 基线+DS | 只用局部 | 76.15 | 76.69 | 23.49 |
| (c) +CNN | 三级局部求和 | 77.62 | 78.35 | 18.57 |
| (d) +SLA | 标准线性注意力 | 79.22 | 78.48 | 20.73 |
| (f) +LCLA | 换上局部补偿 | 80.99 | 80.15 | 17.91 |
| (g) CNN+BMRA 无 LCLA | 校准帮一点 | 81.05 | 80.26 | 10.20 |
| (h) Full | LCLA+BMRA | 82.74 | 81.32 | 9.80 |
因果链:CNN 加深帮有限;SLA→LCLA 是主增益(匀化减轻);BMRA 单独对目标完整度帮助有限,和 LCLA 一起才把虚警和轮廓同时按住。Table IV 的 Full 与 Table I / III 的 82.74 / 81.32 对得上。
LCLA 内部(Table VI):多头会漏弱目标;Focus / 中心化注意力把目标和背景一起放大;去掉局部补偿、改静态补偿、去掉门控,Fa 都会毛;静态补偿在 IRSTD-1K 上虚警尤其差。SMLP 换成 GDFN(偏通道、缺显式空间)也不如。对高效注意力(Table VII):LCLA 精度最高;FLOPs 25.83 G,略高于 FT-Attention 的 24.17 G——正文「最低 FLOPs」这句和表不完全一致,引用时以表为准。
深度(Table X):128 已经能打;最终用 512。噪声和 UAVB(Table XII): 时 IoU 仍 68.57 最高;UAVB 极小极稀目标 IoU 42.09(第二名 HaarTransNet 38.75),但绝对数字说明这个集所有方法都还很难。


图 8 是消融可视化;图 9 是 SLA vs LCLA 末级注意力——SLA 往结构背景上散,LCLA 更收在目标附近。

不是越大越好:NUDT-SIRST 上 IoU 钉在约 96%;SIRST / IRSTD-1K 上 Fa 随 晃,过大就引入背景。所以 SIRST 取 6,另外两个取 4。
局限与讨论
按严重程度:
- IRSTD-1K 的 Fa 不是第一。 DNANet 虚警更低,PHFNet 赢在 IoU / nIoU / Fm / Pd。主表「全面优于 SOTA」需要把 Pd/Fa 拆开读。
- 效率中等,不是卖点。 19.52 M / 25.83 G / 19 ms,远重于 RDIAN / ACM / L2SKNet。全文没有移动端或全尺寸条带红外的延迟测试。
- 「最低 FLOPs」与 Table VII 不一致。 LCLA 25.83 G,FT-Attention 24.17 G。精度第一成立,算力最低不成立。
- 代码尚未放出。 仓库地址写了,截稿时 GitHub 上还搜不到
Llt201/PHFNet。Taylor 公式省略归一化、SMLP 的分组 shift,复现要以官方代码为准。 - UAVB 绝对性能仍低。 相对第二名有约 3.3 个 IoU 点,但 42.09 说明极小极稀目标这条线所有方法都没做干净。论文自己把强噪声稳健表示和极小目标建模写成未来工作。
- 单帧、单模态、官方划分。 没有多帧运动、没有红外–可见光融合,也没有跨数据集训练–测试。噪声实验是在 SIRST 上加高斯,不是传感器真实噪声。
- 定性图带示意框。 红 / 绿 / 黄框是作者标注,不能替代像素级指标。
总结
PHFNet 把红外小目标检测写成一个时序约束下的结构题:弱目标会在下采样中途消失 → 全局建模必须从第一级开始;全阶段并行撞上 → 必须线性注意力;线性注意力会匀化 → 局部补偿必须带幅度约束和门,裸加 DWC 会抬虚警;双支路加完会对不齐 → 融合后还要轴向 avg/max 校准,而不是再叠一条特征提取支路。
对做弱小目标分割的人,可迁移的是这套「全阶段局部–全局并行 / 线性注意力补局部 / 融合后校准」的分工,以及用 IoU 和 Fa 一起验收,而不是只报检测率。对复现,地址是 Llt201/PHFNet;在代码放出之前,Table I / III / IV 的 82.74 / 81.32 和 SIRST IoU 80.12 是核对实现的锁点。
See also
- VAST 精读:CLIP 持续学习里,视觉分支为什么忘得比文本快 2026-09-11
- StyCona 精读:SVD 把域偏移拆成风格与内容,数据增强各打各的 2026-09-04
- GLCNet 精读:小波打散相干斑,全局-局部协作做真实 SAR 去斑 2026-09-02
- DCRM-ViT 精读:冻结骨干,按样本现调参数的多域视觉 Transformer 2026-08-28
- TGC-Net 精读:把 CLIP 轻量地搬进文本引导医学图像分割 2026-08-26