GLCNet 精读:小波打散相干斑,全局-局部协作做真实 SAR 去斑
论文信息
论文题目:Self-supervised global–local collaborative network for real SAR despeckling
作者:Yang Yang、Jiangong Xu、Yuchuan Bai、Liangyu Chen、Junli Li、Jun Pan、Mi Wang。武汉大学测绘遥感信息工程国家重点实验室为主,长沙理工大学、中科院新疆生地所、烟台东方航天港研究院合作。
来源:International Journal of Applied Earth Observation and Geoinformation 146 (2026) 105135。2025-10-26 投稿,2026-01-26 录用,CC BY-NC-ND 开放获取。
论文:DOI: 10.1016/j.jag.2026.105135,代码与数据:github.com/yangyang12318/LGCN。
命名备注:正文方法名是 GLCNet(Global-Local Collaborative Network),仓库与 Fig. 19 标签写成 LGCN,下文按正文用 GLCNet。
先看结论
GLCNet 回答的问题很具体:真实 SAR 没有干净图,相干斑又是乘性、空间相关的,怎么在单张图上自监督去斑,同时别把纹理抹平?
做法是把任务拆成两条互相矛盾的路,再自适应焊回去:
| 组件 | 职责 | 通俗角色 |
|---|---|---|
| WSD(Wavelet-Shuffle Downsampling) | Haar 小波无损拆频,再对子带做 ×2 shuffle | 把粘在一起的斑点拆开,纹理尽量不断 |
| 全局支路 | 降采样后多尺度盲点卷积 + 5 层空洞卷积 | 大范围抹匀质区的斑 |
| 局部支路 | 全分辨率;一条 3×3 盲点,一条 FFT 低通后再 5×5 盲点 | 保点目标和锐边 |
| DGM(Detail-Guided Module) | 局部特征出空间门控,残差注入全局,再 SE 重标定 | 匀质区听全局,边缘听局部 |
关键数字(Sentinel-1,相对 AML 伪真值):MAE 19.5117、RMSE 29.7451、PSNR 18.9557、SSIM 0.6889,四项全表最优;MoR / MoI 最接近 1。GF-3 / TerraSAR-X / Capella-X(0.35 m)上同样用无参考指标对比。下游 AIR-PolSAR-Seg-2.0 地物分类:mIoU 73.61(原图 46.11),PA 86.93(原图 59.04)。参数 9.42 M,256×256 推理 29.07 ms(RTX 3090)。
一个实验前提:Sentinel-1 的「干净图」是 Fang et al. (2024) 的自适应多视(AML)结果,只用于测试,绝不进训练。四个传感器各自独立训练,不是一个通吃模型。
背景:真实 SAR 去斑卡在哪
SAR 全天时全天候,但相干成像必然带斑。斑是乘性、空间相关的:匀质区近似 Gamma,异质/极异质区(森林、城区)会变成重尾的 K / ,聚焦时的点扩散函数再把邻域像素焊在一起。去斑是后续解译的前置步骤。
传统三条线各有死法:
- 空域滤波(Lee / Frost / Kuan):匀质区还行,城区边缘一滤就糊。
- 变换域(小波、曲波):斑和纹理在基函数上可分,反变换容易 Gibbs / 伪影。
- 非局部(PPB、SAR-BM3D):靠块相似加权,相似度量一偏就糊或留噪。
深度学习这边,监督方法(SAR-CNN 及后续)几乎都把光学图加模拟斑当监督。问题是模拟斑对不上真实斑的非高斯统计和系统引入的空间相关,换更重的网络也过不了这个域差。多时相合成「干净图」又怕地物变了;从 SAR 抠斑再贴到光学上,会破坏原始散射分布。
自监督看起来对症:只拿含斑图训练。现有做法仍卡在一个单流困境——降采样能打断斑的空间相关,但必然丢细纹理;保全分辨率能留细节,相关斑又去不干净。Pixel-shuffle(AP-BSN 一路)小因子打不散强相关,大因子(×4 / ×8)把邻接像素拆开,棋盘伪影和糊边一起出现。Speckle2Void 还要先做 whitening,高纹理城区容易被当成相关噪声抹掉。
GLCNet 的切口就是这句话:把去斑拆成「去相关」和「保细节」两路,再用门控融合,而不是在一个尺度上硬兼。
总体架构:双支路 + 门控焊回

图 1 把符号一次讲完:输入单通道 SAR → 上支路 WSD 拆频、盲点卷积、DCL、WSU 出全局结果;下支路一条直通、一条 LPF 后再盲点卷积,出局部结果;两路特征进 DGM,得到最终去斑图。三条损失分别钉在全局输出、局部输出和最终输出上。

图 2 是同一套结构的展开版。值得对着看的三个细节:
- 两路都是 3×3 与 5×5 双流盲点卷积,不是单核;
- 全局支路的下采样是 WSD,上采样是 WSU,通道在降采样域扩到 256,升回来变成 64;
- 损失不是只盯最终图:全局 / 局部各自对输入做 ,最终图再分别向两路对齐,外加 TV。
前向可以缩成:
x (H×W×1)
├─ 全局:WSD → Conv1(4→256) → BSC 3/5 → DCL×5 → WSU → concat → Conv → F_out^g
├─ 局部:x 与 FFT-LPF(x) 分两路 Conv1 → BSC 3/5 → DCL×5 → concat → Conv → F_out^l
└─ DGM(F_l, F_g) → Conv → F_out
WSD:为什么不用 pixel-shuffle
盲点网络(BSN)的前提是噪声空间独立:中心像素被挡住,只能靠邻域预测。SAR 斑偏偏相关,直接上 BSN 会把相关斑当成纹理留下。所以必须先去相关。
![]()
图 3 是现成做法:周期重排像素。×2 时相关还在;×4 时邻接关系被拆碎,空间连续性没了。训练 / 测试用不同因子能缓解,但混叠和棋盘伪影去不掉,采样系数也难定。

WSD 先用 Haar 四个滤波器把图拆成 LL / HL / LH / HH,空间各减半:
- 低频轮廓
- 竖边
- 横边
- 对角与细纹理
再在每个子带上做 因子 2 的 pixel-shuffle。小波分解可逆、信息守恒,论文认为这样能在打散斑相关的同时少引入混叠。后面消融会证明:同样非对称采样,WSD 的 PSNR 比 pixel-shuffle 高出约 3.5 dB。
全局支路:在去相关之后抓大结构

输入 ,WSD 得到 ,再 卷积扩到 256 通道。随后两条盲点流:
每条流再叠 5 个空洞卷积层(DCL),带残差:
论文把感受野摊成一张表:WSD 把输入感受野放大 4 倍,3×3 / 5×5 盲点卷积对应有效感受野 12 与 20;5 个 DCL 之后变成 92×92 与 140×140。训练 patch 是 256×256,这个感受野够抓长程结构,也是「全局」二字的来源。
WSU 把 折回 ,两流拼接后再经一组 卷积得到 。正文公式把 concat 写成了 cocat,实现时按拼接理解即可。
局部支路:全分辨率 + 频域低通
全局支路靠降采样去相关,点目标和锐边会被采样分辨率卡住。局部支路因此不做空间降采样。

两条平行流,结构同构(Conv1 → BSC → DCL×5),差别在入口:
- 上支:原图直通,3×3 盲点,保细纹理;
- 下支:先 FFT 低通,再 5×5 盲点,稳局部结构。
低通不是空域平滑。论文用 2D FFT,零频移到中心,再加一个中心 60×60 的矩形掩膜 ,IFFT 回空域。正文公式 (6) 写的是对幅度谱做掩膜:
按字面会丢掉相位,低通重建对相位敏感。更合理的实现是掩膜乘在复频谱上;引用这条公式时应以官方代码为准。
两流在全分辨率上各出 64 通道特征,拼接后得到 。论文对这条支路的定位很明确:没有 WSD 的物理去相关,相关弱斑去不干净,画面上会残留一点颗粒或伪纹理——这正是后面必须靠 DGM 而不是直接相加的原因。
DGM:匀质听全局,边缘听局部
两路直接加会出问题。全局偏平滑,局部偏高频也更易夹噪;SAR 里不同地物还可能散射签名相近(scattering feature confusion)。自监督标签又是原图本身,局部支路更接近原图、损失更好降,融合权重会倒向局部,全局的结构约束等于白做。

DGM 对 3×3 / 5×5 两对特征各做一次:
- 局部特征 经 +ReLU 混合通道;
- 聚局部上下文,再 +Sigmoid 得到与输入同形状的门控图 ;
- 残差注入:以全局 为底,只在 高响应处加入 ;
- SE(GAP → 两层 → Sigmoid)做通道重标定;
- 两路 concat,再一组 Conv1 降到单通道 。
在边缘 / 纹理区偏大、匀质区偏小:匀质区放大全局去斑,点目标把主导权交给局部。这是「按区域关门」而不是学一个全局混合比。
损失函数
、 分别是全局 / 局部输出对输入 的 (盲点约束下,这就是 Noise2Self 式的自监督)。 再把最终输出分别向两路对齐,并加 TV:
。TV 压高频振荡,同时希望保住结构边。三路损失一起迫使 DGM 真的用上两路,而不是塌成其中一路的拷贝。
实验设置
四个传感器,分辨率从 18 m 到 0.35 m:
| 数据 | 模式 / 分辨率 | 训练 patch(256,stride 64) | 测试 |
|---|---|---|---|
| Sentinel-1 | AML 伪真值仅测试 | 250 张 512→2250 patch | 20 张 |
| GF-3 | UFS,单极化,3 m | 16,150 | 768×768 典型场景 |
| TerraSAR-X | ScanSAR,18 m | 14,454 | 同上 |
| Capella-X | Spotlight,0.35 m | 5,910 | 同上 |
训练:PyTorch 1.11 + CUDA 11.3,RTX 3090,Adam,batch 14,10,000 iter,初学率 ,余弦退火到 0。对比方法含 SAR-BM3D / PPB / FANS,以及 Speckle2Void、AP-BSN、SAR-USE、S3DIP、SDUDNet;其他传感器上深度学习方法都按对应数据从头训。
Sentinel-1 用有参考指标(相对 AML):MAE、RMSE、PSNR、SSIM,外加 MoR / MoI。其他传感器没有真值,用 MoR、MoI、ENL、EPI(水平 / 垂直)。MoR / MoI 越近 1 越好;ENL 高表示匀质区更干净,但也可以是过平滑;EPI 近 1 表示异质区边缘留得住。
Sentinel-1:有参考指标全表第一

有参考四项 GLCNet 全最优。传统方法里 SAR-BM3D 明显强于 PPB;深度学习里 S3DIP、SDUDNet 多次拿第二。无参考方面 GLCNet 的 MoR / MoI 最接近 1,辐射保真更好。AML 是多视平均的伪真值,论文自己也说有偏,所以同时报了 MoR / MoI。

图 10 两景(山脊纹理 / 城区)。PPB 纹理掉得重,比值图里还能看到结构;SAR-BM3D 好一些,边界仍有块效应。Speckle2Void / AP-BSN 匀质区干净,细结构被当成相关噪声抹掉。S3DIP / SDUDNet 高频区有斑泄漏,比值图不均匀。GLCNet 的比值图最接近随机斑、几何结构最少——这是「去掉的是斑、不是地物」的视觉证据。
跨传感器:3 m 到 0.35 m

读这张表不能只看加粗。GLCNet 的 MoR / MoI 在三个传感器上大多最接近 1;Capella-X 上 MoR 0.994 / MoI 1.004,几乎贴理论值。但 ENL 并不是最高:GF-3 上 AP-BSN 的 ENL 是 4.012,GLCNet 只有 1.567;PPB 在 Capella-X 上 ENL 75.26,EPI 却掉到 0.23。高 ENL 经常伴随过平滑,EPI 才反映边缘。深度学习去相关方法(Speckle2Void、AP-BSN)ENL 好看、EPI 很差(GF-3 上 EPI-H 只有 0.07–0.08),和可视化里的过平滑一致。GLCNet 的定位是辐射保真 + 边缘折中,不是「匀质区最干净」。
消融:两路缺一不可,盲点是前提


| 变体 | PSNR | SSIM | 现象 |
|---|---|---|---|
| 仅全局 | 16.65 | 0.536 | 匀质区干净,点目标分辨率不够 |
| 仅局部 | 17.73 | 0.653 | 边还在,相关斑去不净 |
| 两路直接融(无 DGM) | 17.93 | 0.665 | 几乎塌成局部支路 |
| 完整 GLCNet | 18.96 | 0.689 | 折中成立 |
| 盲点换成普通卷积 | 16.86 | 0.638 | 学成恒等映射,等于没去斑 |
两处机制结论:
- 无 DGM ≈ 局部支路(MAE 21.51 vs 21.56)。自监督标签是原图,局部支路损失更好降,融合被它绑架。DGM 把 PSNR 从 17.93 拉到 18.96,不是装饰。
- 盲点不能省。普通卷积能看见中心像素,最小 的解就是复制输入。容量再大也没用,这是自监督能成立的前提,不是精度微调。
DCL 层数另做了 3 / 5 / 7 / 9 的扫描:3 层糊,5 层最好(PSNR 18.955),再加深开始把噪声分布也重建回来。最终锁 5 层。
采样策略:非对称 W21 才是关键


| 模式 | 训练 | 测试 | PSNR | SSIM |
|---|---|---|---|---|
| 不降采样 | 1 | 1 | 16.88 | 0.638 |
| WSD W21 | 2 | 1 | 18.96 | 0.689 |
| WSD W22 | 2 | 2 | 14.59 | 0.297 |
| Pixel-shuffle P21 | 2 | 1 | 15.49 | 0.375 |
| Pixel-shuffle P41 / P42 | 4 | 1 / 2 | ~13.3–13.4 | ~0.17 |
三件事:
- 训练不降采样,相关斑打不散,网络走向恒等;
- 测试仍用 ×2(W22)必须再上采样,核-步长不对齐会出周期网格,SSIM 崩到 0.30;
- 同样非对称 2/1,WSD 比 pixel-shuffle 高 3.46 dB。Pixel-shuffle 本身已经破坏空间连续性,异步采样救不回来。
所以 WSD 的贡献不只是「换了小波」,而是 训练时 ×2 去相关、测试时 ×1 保高频 这套非对称约束,在可逆分解上才能成立。
效率

256×256、batch=1、RTX 3090:
| 方法 | 参数 (M) | 推理 (ms) |
|---|---|---|
| Speckle2Void | 28.83 | 13.5 |
| AP-BSN | 44.05 | 221.7 |
| SAR-USE | 9.52 | 5.92 |
| SDUDNet | 43.96 | 1.67 |
| GLCNet | 9.42 | 29.07 |
S3DIP 是逐图迭代的 Deep Image Prior,不进这张对比。GLCNet 参数和 SAR-USE 同一档,比 AP-BSN / SDUDNet 轻一个数量级;29 ms 比 SAR-USE / SDUDNet 慢,论文把账算在 WSD 的频域分解上。这不是速度最优解,是「参数可控、精度优先」的折中。结论里也把压缩模型和大规模 SAR 快处理写成未来工作。
下游:去斑是为了分类
附录用 AIR-PolSAR-Seg-2.0(三座城市的 GF-3 全极化,8 m,水 / 植被 / 裸地 / 道路 / 建筑 / 山),HH+HV+VV 合成 RGB,DeepLabv3+(ResNet-101)做语义分割。训练 1233 / 测试 309 张 512×512。

原图斑点被当成高频结构,大片背景误分成建筑。PPB 过平滑,建筑被吃成植被;Speckle2Void / AP-BSN 大匀质区边界干净,建筑纹理没了。图 19 标签写的是 LGCN,对应正文 GLCNet。

GLCNet:水 84.98、植被 80.47、裸地 62.99、建筑 79.87、山 93.29,mIoU 73.61、PA 86.93。植被 IoU 从原图 15.44 拉到 80.47,是最夸张的一列。道路上 SDUDNet 的 41.27 略高于 GLCNet 的 40.05,不是六类全胜。PPB 的 mIoU 40.36 甚至低于原图 46.11——去斑过猛会伤害下游,不是「越干净越好」。
局限与讨论
按严重程度:
- 有参考指标绑在 AML 伪真值上。Sentinel-1 的 PSNR / SSIM 比的是多视平均,不是无斑真值。论文用 MoR / MoI 对冲,但主表排序仍受 AML 偏差影响。
- 不是跨传感器通吃模型。四个数据各自从头训练。换星、换模式、换分辨率都要重训,和「预处理即插即用」还有距离。
- ENL 叙事需要自己读表。正文强调全面优越,表 3 里 GLCNet 的 ENL 经常低于 AP-BSN / PPB。真正的卖点是 MoR / MoI 近 1 且 EPI 不太崩,不是匀质区最干净。
- 公式与实现有缝。公式 (6) 对幅度做掩膜会丢相位;公式 (4)(10) 的
cocat是笔误;Fig. 1 图例把 Blind 写成 Bind。频域低通窗口 60×60 没有消融。 - 自监督目标仍是「像输入」。盲点 + TV 能阻止恒等,但没有显式的斑统计约束(Gamma / )。极端异质区是否保散射分布,只靠分类代理任务间接说明。
- 道路类没有拿下。表 6 里道路 IoU 低于 SDUDNet,细长异质结构仍是弱点;结论自己也承认边界和细结构仍有信息损失。
- 效率不是卖点。9.42 M / 29 ms 对 256 图可以,全尺寸条带 SAR 要切块,未来工作才是压缩。
总结
GLCNet 把真实 SAR 去斑写成一个物理约束下的结构题:斑相关 → 必须去相关;去相关要降采样 → 必须另开一路保细节;自监督标签是原图 → 融合不能直接加,必须门控,否则塌到局部支路;中心像素可见 → 普通卷积会恒等,盲点是前提。WSD 的非对称 W21(训 ×2、测 ×1)是比「双支路」更硬的设计点,表 5 里同设定 pixel-shuffle 直接崩盘。
对做 SAR 预处理的人,可迁移的是这套「去相关尺度 / 保边尺度 / 空间门控」的分工,以及用下游分割而不是只看 ENL 来验收去斑。对复现,仓库是 yangyang12318/LGCN;读公式时以代码为准,尤其是 FFT 低通那一步。
See also
- VAST 精读:CLIP 持续学习里,视觉分支为什么忘得比文本快 2026-09-11
- StyCona 精读:SVD 把域偏移拆成风格与内容,数据增强各打各的 2026-09-04
- PHFNet 精读:全阶段并行 CNN–Transformer,线性注意力里把弱红外目标补回来 2026-09-03
- DCRM-ViT 精读:冻结骨干,按样本现调参数的多域视觉 Transformer 2026-08-28
- TGC-Net 精读:把 CLIP 轻量地搬进文本引导医学图像分割 2026-08-26