GLCNet 精读:小波打散相干斑,全局-局部协作做真实 SAR 去斑

Date 2026-09-02 · Category tech · Status finished · Confidence likely
论文解读, SAR 去斑, 自监督学习

论文信息

论文题目:Self-supervised global–local collaborative network for real SAR despeckling

作者:Yang Yang、Jiangong Xu、Yuchuan Bai、Liangyu Chen、Junli Li、Jun Pan、Mi Wang。武汉大学测绘遥感信息工程国家重点实验室为主,长沙理工大学、中科院新疆生地所、烟台东方航天港研究院合作。

来源:International Journal of Applied Earth Observation and Geoinformation 146 (2026) 105135。2025-10-26 投稿,2026-01-26 录用,CC BY-NC-ND 开放获取。

论文:DOI: 10.1016/j.jag.2026.105135,代码与数据:github.com/yangyang12318/LGCN

命名备注:正文方法名是 GLCNet(Global-Local Collaborative Network),仓库与 Fig. 19 标签写成 LGCN,下文按正文用 GLCNet。

先看结论

GLCNet 回答的问题很具体:真实 SAR 没有干净图,相干斑又是乘性、空间相关的,怎么在单张图上自监督去斑,同时别把纹理抹平?

做法是把任务拆成两条互相矛盾的路,再自适应焊回去:

组件 职责 通俗角色
WSD(Wavelet-Shuffle Downsampling) Haar 小波无损拆频,再对子带做 ×2 shuffle 把粘在一起的斑点拆开,纹理尽量不断
全局支路 降采样后多尺度盲点卷积 + 5 层空洞卷积 大范围抹匀质区的斑
局部支路 全分辨率;一条 3×3 盲点,一条 FFT 低通后再 5×5 盲点 保点目标和锐边
DGM(Detail-Guided Module) 局部特征出空间门控,残差注入全局,再 SE 重标定 匀质区听全局,边缘听局部

关键数字(Sentinel-1,相对 AML 伪真值):MAE 19.5117、RMSE 29.7451、PSNR 18.9557、SSIM 0.6889,四项全表最优;MoR / MoI 最接近 1。GF-3 / TerraSAR-X / Capella-X(0.35 m)上同样用无参考指标对比。下游 AIR-PolSAR-Seg-2.0 地物分类:mIoU 73.61(原图 46.11),PA 86.93(原图 59.04)。参数 9.42 M,256×256 推理 29.07 ms(RTX 3090)。

一个实验前提:Sentinel-1 的「干净图」是 Fang et al. (2024) 的自适应多视(AML)结果,只用于测试,绝不进训练。四个传感器各自独立训练,不是一个通吃模型。

背景:真实 SAR 去斑卡在哪

SAR 全天时全天候,但相干成像必然带斑。斑是乘性、空间相关的:匀质区近似 Gamma,异质/极异质区(森林、城区)会变成重尾的 K / ,聚焦时的点扩散函数再把邻域像素焊在一起。去斑是后续解译的前置步骤。

传统三条线各有死法:

  • 空域滤波(Lee / Frost / Kuan):匀质区还行,城区边缘一滤就糊。
  • 变换域(小波、曲波):斑和纹理在基函数上可分,反变换容易 Gibbs / 伪影。
  • 非局部(PPB、SAR-BM3D):靠块相似加权,相似度量一偏就糊或留噪。

深度学习这边,监督方法(SAR-CNN 及后续)几乎都把光学图加模拟斑当监督。问题是模拟斑对不上真实斑的非高斯统计和系统引入的空间相关,换更重的网络也过不了这个域差。多时相合成「干净图」又怕地物变了;从 SAR 抠斑再贴到光学上,会破坏原始散射分布。

自监督看起来对症:只拿含斑图训练。现有做法仍卡在一个单流困境——降采样能打断斑的空间相关,但必然丢细纹理;保全分辨率能留细节,相关斑又去不干净。Pixel-shuffle(AP-BSN 一路)小因子打不散强相关,大因子(×4 / ×8)把邻接像素拆开,棋盘伪影和糊边一起出现。Speckle2Void 还要先做 whitening,高纹理城区容易被当成相关噪声抹掉。

GLCNet 的切口就是这句话:把去斑拆成「去相关」和「保细节」两路,再用门控融合,而不是在一个尺度上硬兼。

总体架构:双支路 + 门控焊回

图 1:网络总览。图源:Yang et al., Figure 1, JAG 2026

图 1 把符号一次讲完:输入单通道 SAR → 上支路 WSD 拆频、盲点卷积、DCL、WSU 出全局结果;下支路一条直通、一条 LPF 后再盲点卷积,出局部结果;两路特征进 DGM,得到最终去斑图。三条损失分别钉在全局输出、局部输出和最终输出上。

图 2:GLCNet 完整结构。图源:Yang et al., Figure 2, JAG 2026

图 2 是同一套结构的展开版。值得对着看的三个细节:

  1. 两路都是 3×3 与 5×5 双流盲点卷积,不是单核;
  2. 全局支路的下采样是 WSD,上采样是 WSU,通道在降采样域扩到 256,升回来变成 64;
  3. 损失不是只盯最终图:全局 / 局部各自对输入做 ,最终图再分别向两路对齐,外加 TV。

前向可以缩成:

x (H×W×1)
 ├─ 全局:WSD → Conv1(4→256) → BSC 3/5 → DCL×5 → WSU → concat → Conv → F_out^g
 ├─ 局部:x 与 FFT-LPF(x) 分两路 Conv1 → BSC 3/5 → DCL×5 → concat → Conv → F_out^l
 └─ DGM(F_l, F_g) → Conv → F_out

WSD:为什么不用 pixel-shuffle

盲点网络(BSN)的前提是噪声空间独立:中心像素被挡住,只能靠邻域预测。SAR 斑偏偏相关,直接上 BSN 会把相关斑当成纹理留下。所以必须先去相关。

图 3:Pixel-shuffle 降采样。图源:Yang et al., Figure 3, JAG 2026

图 3 是现成做法:周期重排像素。×2 时相关还在;×4 时邻接关系被拆碎,空间连续性没了。训练 / 测试用不同因子能缓解,但混叠和棋盘伪影去不掉,采样系数也难定。

图 4:Wavelet-shuffle 降采样。图源:Yang et al., Figure 4, JAG 2026

WSD 先用 Haar 四个滤波器把图拆成 LL / HL / LH / HH,空间各减半:

  • 低频轮廓
  • 竖边
  • 横边
  • 对角与细纹理

再在每个子带上做 因子 2 的 pixel-shuffle。小波分解可逆、信息守恒,论文认为这样能在打散斑相关的同时少引入混叠。后面消融会证明:同样非对称采样,WSD 的 PSNR 比 pixel-shuffle 高出约 3.5 dB。

全局支路:在去相关之后抓大结构

图 5:全局支路。图源:Yang et al., Figure 5, JAG 2026

输入 ,WSD 得到 ,再 卷积扩到 256 通道。随后两条盲点流:

每条流再叠 5 个空洞卷积层(DCL),带残差:

论文把感受野摊成一张表:WSD 把输入感受野放大 4 倍,3×3 / 5×5 盲点卷积对应有效感受野 12 与 20;5 个 DCL 之后变成 92×92 与 140×140。训练 patch 是 256×256,这个感受野够抓长程结构,也是「全局」二字的来源。

WSU 把 折回 ,两流拼接后再经一组 卷积得到 。正文公式把 concat 写成了 cocat,实现时按拼接理解即可。

局部支路:全分辨率 + 频域低通

全局支路靠降采样去相关,点目标和锐边会被采样分辨率卡住。局部支路因此不做空间降采样。

图 6:局部支路。图源:Yang et al., Figure 6, JAG 2026

两条平行流,结构同构(Conv1 → BSC → DCL×5),差别在入口:

  • 上支:原图直通,3×3 盲点,保细纹理;
  • 下支:先 FFT 低通,再 5×5 盲点,稳局部结构。

低通不是空域平滑。论文用 2D FFT,零频移到中心,再加一个中心 60×60 的矩形掩膜 ,IFFT 回空域。正文公式 (6) 写的是对幅度谱做掩膜:

按字面会丢掉相位,低通重建对相位敏感。更合理的实现是掩膜乘在复频谱上;引用这条公式时应以官方代码为准。

两流在全分辨率上各出 64 通道特征,拼接后得到 。论文对这条支路的定位很明确:没有 WSD 的物理去相关,相关弱斑去不干净,画面上会残留一点颗粒或伪纹理——这正是后面必须靠 DGM 而不是直接相加的原因。

DGM:匀质听全局,边缘听局部

两路直接加会出问题。全局偏平滑,局部偏高频也更易夹噪;SAR 里不同地物还可能散射签名相近(scattering feature confusion)。自监督标签又是原图本身,局部支路更接近原图、损失更好降,融合权重会倒向局部,全局的结构约束等于白做。

图 7:Detail-Guided Module。图源:Yang et al., Figure 7, JAG 2026

DGM 对 3×3 / 5×5 两对特征各做一次:

  1. 局部特征 +ReLU 混合通道;
  2. 聚局部上下文,再 +Sigmoid 得到与输入同形状的门控图
  3. 残差注入:以全局 为底,只在 高响应处加入
  4. SE(GAP → 两层 → Sigmoid)做通道重标定;
  5. 两路 concat,再一组 Conv1 降到单通道

在边缘 / 纹理区偏大、匀质区偏小:匀质区放大全局去斑,点目标把主导权交给局部。这是「按区域关门」而不是学一个全局混合比。

损失函数

分别是全局 / 局部输出对输入 (盲点约束下,这就是 Noise2Self 式的自监督)。 再把最终输出分别向两路对齐,并加 TV:

。TV 压高频振荡,同时希望保住结构边。三路损失一起迫使 DGM 真的用上两路,而不是塌成其中一路的拷贝。

实验设置

四个传感器,分辨率从 18 m 到 0.35 m:

数据 模式 / 分辨率 训练 patch(256,stride 64) 测试
Sentinel-1 AML 伪真值仅测试 250 张 512→2250 patch 20 张
GF-3 UFS,单极化,3 m 16,150 768×768 典型场景
TerraSAR-X ScanSAR,18 m 14,454 同上
Capella-X Spotlight,0.35 m 5,910 同上

训练:PyTorch 1.11 + CUDA 11.3,RTX 3090,Adam,batch 14,10,000 iter,初学率 ,余弦退火到 0。对比方法含 SAR-BM3D / PPB / FANS,以及 Speckle2Void、AP-BSN、SAR-USE、S3DIP、SDUDNet;其他传感器上深度学习方法都按对应数据从头训。

Sentinel-1 用有参考指标(相对 AML):MAE、RMSE、PSNR、SSIM,外加 MoR / MoI。其他传感器没有真值,用 MoR、MoI、ENL、EPI(水平 / 垂直)。MoR / MoI 越近 1 越好;ENL 高表示匀质区更干净,但也可以是过平滑;EPI 近 1 表示异质区边缘留得住。

Sentinel-1:有参考指标全表第一

表 2:Sentinel-1 定量对比。图源:Yang et al., Table 2, JAG 2026

有参考四项 GLCNet 全最优。传统方法里 SAR-BM3D 明显强于 PPB;深度学习里 S3DIP、SDUDNet 多次拿第二。无参考方面 GLCNet 的 MoR / MoI 最接近 1,辐射保真更好。AML 是多视平均的伪真值,论文自己也说有偏,所以同时报了 MoR / MoI。

图 10:Sentinel-1 去斑可视化。红框放大,绿框是比值图。图源:Yang et al., Figure 10, JAG 2026

图 10 两景(山脊纹理 / 城区)。PPB 纹理掉得重,比值图里还能看到结构;SAR-BM3D 好一些,边界仍有块效应。Speckle2Void / AP-BSN 匀质区干净,细结构被当成相关噪声抹掉。S3DIP / SDUDNet 高频区有斑泄漏,比值图不均匀。GLCNet 的比值图最接近随机斑、几何结构最少——这是「去掉的是斑、不是地物」的视觉证据。

跨传感器:3 m 到 0.35 m

表 3:GF-3 / TerraSAR-X / Capella-X。图源:Yang et al., Table 3, JAG 2026

读这张表不能只看加粗。GLCNet 的 MoR / MoI 在三个传感器上大多最接近 1;Capella-X 上 MoR 0.994 / MoI 1.004,几乎贴理论值。但 ENL 并不是最高:GF-3 上 AP-BSN 的 ENL 是 4.012,GLCNet 只有 1.567;PPB 在 Capella-X 上 ENL 75.26,EPI 却掉到 0.23。高 ENL 经常伴随过平滑,EPI 才反映边缘。深度学习去相关方法(Speckle2Void、AP-BSN)ENL 好看、EPI 很差(GF-3 上 EPI-H 只有 0.07–0.08),和可视化里的过平滑一致。GLCNet 的定位是辐射保真 + 边缘折中,不是「匀质区最干净」。

消融:两路缺一不可,盲点是前提

图 14:模块消融可视化。图源:Yang et al., Figure 14, JAG 2026

表 4:模块消融。图源:Yang et al., Table 4, JAG 2026

变体 PSNR SSIM 现象
仅全局 16.65 0.536 匀质区干净,点目标分辨率不够
仅局部 17.73 0.653 边还在,相关斑去不净
两路直接融(无 DGM) 17.93 0.665 几乎塌成局部支路
完整 GLCNet 18.96 0.689 折中成立
盲点换成普通卷积 16.86 0.638 学成恒等映射,等于没去斑

两处机制结论:

  • 无 DGM ≈ 局部支路(MAE 21.51 vs 21.56)。自监督标签是原图,局部支路损失更好降,融合被它绑架。DGM 把 PSNR 从 17.93 拉到 18.96,不是装饰。
  • 盲点不能省。普通卷积能看见中心像素,最小 的解就是复制输入。容量再大也没用,这是自监督能成立的前提,不是精度微调。

DCL 层数另做了 3 / 5 / 7 / 9 的扫描:3 层糊,5 层最好(PSNR 18.955),再加深开始把噪声分布也重建回来。最终锁 5 层。

采样策略:非对称 W21 才是关键

图 16:不同采样模式。P=pixel-shuffle,W=wavelet-shuffle,数字为训练/测试因子。图源:Yang et al., Figure 16, JAG 2026

表 5:采样模式定量。图源:Yang et al., Table 5, JAG 2026

模式 训练 测试 PSNR SSIM
不降采样 1 1 16.88 0.638
WSD W21 2 1 18.96 0.689
WSD W22 2 2 14.59 0.297
Pixel-shuffle P21 2 1 15.49 0.375
Pixel-shuffle P41 / P42 4 1 / 2 ~13.3–13.4 ~0.17

三件事:

  1. 训练不降采样,相关斑打不散,网络走向恒等;
  2. 测试仍用 ×2(W22)必须再上采样,核-步长不对齐会出周期网格,SSIM 崩到 0.30;
  3. 同样非对称 2/1,WSD 比 pixel-shuffle 高 3.46 dB。Pixel-shuffle 本身已经破坏空间连续性,异步采样救不回来。

所以 WSD 的贡献不只是「换了小波」,而是 训练时 ×2 去相关、测试时 ×1 保高频 这套非对称约束,在可逆分解上才能成立。

效率

图 17:参数量与推理时间。图源:Yang et al., Figure 17, JAG 2026

256×256、batch=1、RTX 3090:

方法 参数 (M) 推理 (ms)
Speckle2Void 28.83 13.5
AP-BSN 44.05 221.7
SAR-USE 9.52 5.92
SDUDNet 43.96 1.67
GLCNet 9.42 29.07

S3DIP 是逐图迭代的 Deep Image Prior,不进这张对比。GLCNet 参数和 SAR-USE 同一档,比 AP-BSN / SDUDNet 轻一个数量级;29 ms 比 SAR-USE / SDUDNet 慢,论文把账算在 WSD 的频域分解上。这不是速度最优解,是「参数可控、精度优先」的折中。结论里也把压缩模型和大规模 SAR 快处理写成未来工作。

下游:去斑是为了分类

附录用 AIR-PolSAR-Seg-2.0(三座城市的 GF-3 全极化,8 m,水 / 植被 / 裸地 / 道路 / 建筑 / 山),HH+HV+VV 合成 RGB,DeepLabv3+(ResNet-101)做语义分割。训练 1233 / 测试 309 张 512×512。

图 19:去斑结果与地物分类图。图源:Yang et al., Figure 19, JAG 2026

原图斑点被当成高频结构,大片背景误分成建筑。PPB 过平滑,建筑被吃成植被;Speckle2Void / AP-BSN 大匀质区边界干净,建筑纹理没了。图 19 标签写的是 LGCN,对应正文 GLCNet。

表 6:分类 IoU。图源:Yang et al., Table 6, JAG 2026

GLCNet:水 84.98、植被 80.47、裸地 62.99、建筑 79.87、山 93.29,mIoU 73.61、PA 86.93。植被 IoU 从原图 15.44 拉到 80.47,是最夸张的一列。道路上 SDUDNet 的 41.27 略高于 GLCNet 的 40.05,不是六类全胜。PPB 的 mIoU 40.36 甚至低于原图 46.11——去斑过猛会伤害下游,不是「越干净越好」。

局限与讨论

按严重程度:

  1. 有参考指标绑在 AML 伪真值上。Sentinel-1 的 PSNR / SSIM 比的是多视平均,不是无斑真值。论文用 MoR / MoI 对冲,但主表排序仍受 AML 偏差影响。
  2. 不是跨传感器通吃模型。四个数据各自从头训练。换星、换模式、换分辨率都要重训,和「预处理即插即用」还有距离。
  3. ENL 叙事需要自己读表。正文强调全面优越,表 3 里 GLCNet 的 ENL 经常低于 AP-BSN / PPB。真正的卖点是 MoR / MoI 近 1 且 EPI 不太崩,不是匀质区最干净。
  4. 公式与实现有缝。公式 (6) 对幅度做掩膜会丢相位;公式 (4)(10) 的 cocat 是笔误;Fig. 1 图例把 Blind 写成 Bind。频域低通窗口 60×60 没有消融。
  5. 自监督目标仍是「像输入」。盲点 + TV 能阻止恒等,但没有显式的斑统计约束(Gamma / )。极端异质区是否保散射分布,只靠分类代理任务间接说明。
  6. 道路类没有拿下。表 6 里道路 IoU 低于 SDUDNet,细长异质结构仍是弱点;结论自己也承认边界和细结构仍有信息损失。
  7. 效率不是卖点。9.42 M / 29 ms 对 256 图可以,全尺寸条带 SAR 要切块,未来工作才是压缩。

总结

GLCNet 把真实 SAR 去斑写成一个物理约束下的结构题:斑相关 → 必须去相关;去相关要降采样 → 必须另开一路保细节;自监督标签是原图 → 融合不能直接加,必须门控,否则塌到局部支路;中心像素可见 → 普通卷积会恒等,盲点是前提。WSD 的非对称 W21(训 ×2、测 ×1)是比「双支路」更硬的设计点,表 5 里同设定 pixel-shuffle 直接崩盘。

对做 SAR 预处理的人,可迁移的是这套「去相关尺度 / 保边尺度 / 空间门控」的分工,以及用下游分割而不是只看 ENL 来验收去斑。对复现,仓库是 yangyang12318/LGCN;读公式时以代码为准,尤其是 FFT 低通那一步。


See also