LSM:用语义调制把 LRU 带进图像超分

Date 2026-07-06 · Category tech · Status finished · Confidence likely
论文解读, 计算机视觉

论文信息

论文题目:Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution

论文地址:arXiv:2606.19901

代码地址:MingyuChoi-run/LSM

这篇论文做的是经典单图超分辨率,也就是从低分辨率图像恢复高分辨率图像。它的核心想法不是继续堆 Transformer 或 Mamba 模块,而是尝试把 Linear Recurrent Unit, LRU 变成一个适合图像超分的 backbone。

先说结论:LSM 的价值在于提出了一种折中路线。

LRU: 高效、稳定、可解释,但静态扫描不够适合图像
Mamba/S6: 输入自适应更强,但动态扫描和工程复杂度更高
LSM: 保留 LRU 主干,用语义调制补上内容自适应能力

LSM 的整体动机图


动机:为什么 LRU 需要语义调制

图像超分不只是把像素放大。模型既要恢复局部细节,比如边缘、纹理、线条,也要利用长距离上下文,比如建筑整体结构、重复窗户、漫画线条的一致性。

Transformer 可以做长距离交互,但全局 attention 很贵。Mamba/SSM 类方法用线性复杂度建模长序列,但通常依赖动态参数化、选择性扫描和更复杂的实现。LRU 的优势刚好相反:递归核心简单、稳定、线性复杂度,适合长序列。

问题在于,原始 LRU 是静态递归。它的基本形式是:

其中 对所有 token 基本是同一套规则。也就是说,不管当前 token 来自天空、建筑、草地还是边缘,LRU 都用相同的递归动力学处理。

这对图像超分是不够的。建筑区域需要结构线条,草地区域需要纹理,天空区域需要平滑一致,边界区域需要锐利过渡。作者认为,LRU 的效率值得保留,但必须让它感知图像内容。

Vanilla LRU 与语义调制 LRU 的对比

这张图很关键。左边的 vanilla LRU 更像是在均匀保留信息;中间的 SMU 先根据语义相似性理解 token;右边的 modulated LRU 再根据类别调制递归状态,让模型在不同区域关注不同信息。


方法总览:WMS + CML 的局部全局结构

LSM 的完整网络不是只堆 LRU,而是采用局部和全局交替的结构:

LR image
-> 3x3 Conv
-> 多个 LSM group
   -> WMS block
   -> CML block
-> 3x3 Conv
-> PixelShuffle
-> HR image

LSM 的整体网络结构

其中:

  • WMS block 是 Window-based Multi-head Self-attention,本质上是局部窗口 Transformer block,负责局部纹理和短距离结构。
  • CML block 是 Category-based Modulated LRU,是论文核心模块,负责语义调制的长程建模。
  • 每个 block 仍然沿用 Transformer 风格:LayerNorm -> token mixing -> residual -> LayerNorm -> Gated MLP -> residual

这个组合的逻辑比较清楚:

WMS: 看近处,恢复局部细节
CML: 看远处,建模语义相关区域

例如建筑图像里,WMS 可以恢复局部窗框边缘,CML 可以利用远处相似窗户的结构,让重复纹理更一致。


LRU:一个稳定的线性递归扫描器

LRU 可以理解成一个按顺序扫描 token 的状态空间模块。输入序列是:

每来一个 token,LRU 更新隐藏状态:

然后读出输出:

这里最重要的是 。它控制旧隐藏状态保留多少,也就是记忆长度。论文使用复数特征值来参数化 ,可以把它粗略理解成:

  • 控制记忆衰减速度。 越接近 ,记忆越长。
  • 控制相位和振荡模式,有利于表达周期性、纹理性结构。

论文把 作为最终配置。这个选择说明,在超分任务里,LRU 需要较长记忆,也需要足够丰富的频率表达,而不是只关注低频平滑结构。


CML:把静态 LRU 变成语义调制 LRU

CML 的核心是把原始 LRU 改成带调制 token 的形式。

原始 LRU 是:

LSM 改成:

这些 就是 SMU 生成的调制 token:

  • 调制旧状态保留程度;
  • 调制当前输入注入方式;
  • 调制隐藏状态如何输出。

直观理解就是:

普通 LRU: 一套规则扫完整张图
LSM: 根据 token 的语义类别调整 LRU 的状态更新

LRU 与 SMU 的内部流程


SMU:一个模块承担三件事

SMU 是 Semantic Modulating Unit。它有一个可学习字典:

可以把字典看成一组 learned prototypes,也就是模型自己学到的语义原型。给定输入特征 ,SMU 计算输入 token 和字典 prototype 的相似度:

这个相似度矩阵同时服务三个功能。

第一,生成调制 token。对相似度做 softmax 后切成四份:

得到 ,分别去调制 LRU 的状态转移、输入注入和输出矩阵。

第二,语义分类。SMU 给每个 token 分配语义组,再把 token 按语义类别重排后送入 LRU。这样空间上相隔很远但语义相似的区域,可以在一次扫描里更容易交互。

第三,全局增强。SMU 还做一个字典 cross-attention:

最后把 LRU 分支和增强分支拼接:

所以 SMU 不是单纯的 gate,而是同时完成:

semantic categorization
+ LRU modulation
+ dictionary-based feature enhancement

实验设置

作者做了 classic SR 实验,倍率包括 ,测试集是:

Set5, Set14, B100, Urban100, Manga109

评价指标是 PSNR 和 SSIM。

模型有三个主要版本:

  • LSM-light:轻量模型;
  • LSM-S:小/中等规模模型;
  • LSM:更强版本,把 group 数从 增加到
  • LSM+:测试时使用 self-ensemble。

LSM-S 使用 个 group,每个 group 个 block,通道数 ,LRU state size 为 ,字典类别数为 。LSM-light 则把 state size 和字典类别数分别降到


消融实验:哪些设计真的有用

第一组消融验证 初始化。结果显示, 最好。

lambda 初始化的消融实验

原因是超分同时需要长距离结构和高频纹理。如果半径范围过小,记忆衰减太快;如果相位范围过小,表达会偏低频,细节恢复受损。

第二组消融验证 SMU 的三个角色。完整 SMU 在 Set14 上从 提升到 ,在 Manga109 上从 提升到

SMU 多角色和调制 token 的消融结果

这说明 CategorizeCrossAttn 不是互相替代的,而是互补的。分类帮助 LRU 组织序列,cross-attention 提供全局语义增强,调制 token 则真正改变 LRU 的递归行为。


与 Transformer 和 Mamba 方法对比

作者把 LSM 和 CNN、Transformer、Mamba 三类超分方法比较:

CNN: EDSR
Transformer: SwinIR, CAT, DAT, ART, HAT, RGT
Mamba: MambaIR, MambaIRv2
LRU: LSM

Urban100 上,MambaIRv2-S 是 ,LSM-S 达到 ,LSM 达到 ,LSM+ 达到

Manga109 上,MambaIRv2-S 是 ,LSM-S 达到 ,LSM 达到 ,LSM+ 达到

Urban100 和 Manga109 都很能体现 LSM 的优势。前者有大量建筑重复结构,后者有大量线条和高频纹理,都需要长程一致性和细节恢复。

x4 超分视觉结果对比

从视觉对比看,LSM 对条纹、圆形纹理、建筑立面这类结构恢复得更稳定,伪影更少。作者把这归因于 CML 能在全图范围捕捉相似纹理,并通过语义调制增强一致性。


复杂度:LSM 的主要卖点之一

论文专门比较了参数量和 FLOPs。

复杂度与性能表

和 Mamba 方法相比:

MambaIR:     20.6M params, 394.6G FLOPs, Urban100 x4 27.68
MambaIRv2-S:  9.8M params, 202.9G FLOPs, Urban100 x4 27.73
LSM-S:        9.9M params, 203.5G FLOPs, Urban100 x4 27.88
LSM:         12.9M params, 265.0G FLOPs, Urban100 x4 27.94

LSM-S 和 MambaIRv2-S 的参数量、FLOPs 基本相同,但 PSNR 更高。LSM 相比 MambaIR 则同时降低 FLOPs 并提升性能。

和 Transformer 方法相比,LSM-S 比 CAT-A 参数更少、FLOPs 更低,但 Urban100 和 Manga109 的 PSNR 更高。

PSNR 与 FLOPs 对比

这就是论文想强调的效率点:LRU backbone 的递归计算更轻,SMU 增加了一些语义调制开销,但整体仍然能保持比较好的性能/复杂度比。


隐藏状态和显存分析

论文还可视化了三种隐藏状态:

Vanilla LRU
+ Categorize
+ Categorize & Modulate

隐藏状态可视化

Vanilla LRU 对建筑立面、花茎等关键纹理捕捉较弱;加入分类后,全局结构有所改善;再加入调制后,局部细节和整体结构都更清晰。这说明 SMU 不只是提升指标,而是真的改变了 LRU 的特征表达。

作者还比较了训练显存。LSM-S 相比 MambaIR、MambaIRv2-S 和 RGT-S 更省显存,因此可以在有限硬件下处理更大输入,或者把节省出来的资源用于字典 fine-tuning。

训练显存对比


我的理解

这篇论文的关键不是证明 LRU 全面优于 Mamba 或 Transformer,而是提出了一种很实用的中间路线。

LRU 的问题很明确:它稳定、高效,但静态。图像超分又是一个强内容依赖任务,不同区域需要完全不同的恢复策略。如果直接把 vanilla LRU 用到图像上,表达力会不够。

LSM 的处理方式比较克制:它没有完全走 S6/Mamba 那种动态生成状态空间参数的路线,而是保留 LRU 的静态骨架,再用 SMU 生成语义相关的调制因子。这样既能获得输入自适应能力,又不会把工程复杂度拉得太高。

从设计上看,SMU 的三个角色也比较统一。它用同一个字典相似度矩阵同时做分类、调制和增强,而不是为每个功能单独堆一个分支。这个设计让模块更紧凑,也让语义相似性真正成为 CML 的中心信号。

如果只用一句话概括这篇论文:

LSM 不是把 LRU 简单搬到超分里,而是通过语义字典让 LRU 的扫描和递归更新变得内容相关,从而在效率和重建质量之间取得更好的平衡。


See also