PIMamba:用扩散物理先验约束 Mamba 的少样本高光谱分类
论文信息
论文题目:PIMamba: Physics-Informed Mamba for Few-Shot Hyperspectral Image Classification
作者:Junpei Zhang、Lingling Li、Licheng Jiao、Xu Liu、Fang Liu、Wenping Ma、Shuyuan Yang、Puhua Chen(西安电子科技大学)。
出处:IEEE Transactions on Geoscience and Remote Sensing(TGRS),Vol. 64,2026,Art. no. 5511116。
论文地址:DOI: 10.1109/TGRS.2026.3686126
任务设定:少样本高光谱图像(HSI)分类,每类仅 5 个标注像素样本,不使用外部标注数据或大规模预训练模型。
先看结论
PIMamba 的核心思路可以概括为一句话:标注样本不够时,用高光谱成像机理中蕴含的物理规律补充监督信号。这些约束进入模型的三个层面:
结构层面:Mamba 的状态转移矩阵 A 由物理扩散算子 L_φ = αD + βI 决定
监督层面:光谱分支施加反应–扩散方程残差损失(SpeLoss)
空间分支施加二维扩散方程残差损失(SpaLoss)
优化层面:DPA 机制按梯度范数动态平衡两个物理损失的权重
在四个公开数据集(Indian Pines、University of Pavia、Salinas、Houston 2013)、每类 5 个标注样本、每组实验重复 10 次的协议下,论文报告的结果是:
| 数据集 | PIMamba OA | MambaHSI OA | 提升 |
|---|---|---|---|
| Indian Pines | 79.79 ± 2.59% | 74.13 ± 2.18% | +5.66 |
| University of Pavia | 85.37 ± 3.32% | 81.22 ± 4.45% | +4.15 |
| Salinas | 95.52 ± 1.27% | 92.31 ± 1.29% | +3.21 |
| Houston 2013 | 80.80 ± 1.60% | 76.74 ± 2.95% | +4.06 |
模型参数量为 43.15k–56.43k,约为 MambaHSI 的 10%–13%。需要注意的是,这些数字的适用范围限于上述数据集与 5 样本/类协议,不能直接外推到其他传感器或样本量更充足的场景。
研究动机:标注稀缺时,物理先验补什么
少样本是常态,而不是例外
论文的动机部分先回答了一个问题:数据集越来越大的今天,为什么还要研究少样本 HSI 分类。给出的三个理由都与标注的现实约束有关:
- 标注成本高。高光谱数据的精细标注需要专业知识与实地核查,代价远高于普通 RGB 图像。
- 传感器域差异。不同传感器的光谱响应差异显著,域分布偏移大,已有标注难以直接迁移;换传感器或换区域往往意味着重新标注。
- 稀有类别天然稀缺。稀少矿物、保护植被等地物类型本身样本数量就极少,"多标一些"在这类场景下不可行。
现有路线的共同依赖
针对少样本 HSI 分类,主流方案是迁移学习与元学习:前者在源域预训练再迁移到目标域,后者通过查询集引导优化初始参数。论文指出这些方法仍依赖大量标注数据或高质量的域外数据集;当域外数据不可得或与目标任务分布不匹配时,性能明显退化。
大规模预训练模型路线在 HSI 上同样存在适配问题:预训练得到的通常是类别无关的通用特征,难以刻画高光谱数据特有的细粒度光谱差异与空间结构。由此,论文把研究问题定义为:在不依赖大规模预训练模型、不依赖域外数据的前提下,如何用极少量标注样本实现有效泛化。
从成像机理构造物理约束
论文的回答借鉴了物理信息神经网络(PINN)的思路:物理定律可以作为监督信号嵌入训练过程,在观测数据有限时改善数据效率。但 HSI 分类与波动方程、电磁散射这类有明确控制方程的问题不同——它没有现成的物理方程可用。论文的做法是从高光谱数据的成像机理中提炼两条规律,再为每条构造数学形式:
光谱维度的两个现象:
- 相邻波段的反射率天然平滑。单色光进入仪器后,响应会扩散到邻近波长(仪器响应函数 IRF 的卷积平滑效应),测得的光谱在相邻波段间不会出现突变;
- 特定波长处出现吸收或增强峰谷。Beer–Lambert 定律 描述了均匀介质中的吸收衰减,当吸收系数 在某波长显著增大时,该处形成吸收谷——例如植被的叶绿素强吸收、水体的强红外吸收。
这两条规律合起来对应一个"反应–扩散方程":扩散项负责整体平滑,反应项允许局部峰谷。
空间维度的两个现象:
- 同质地物区域(森林、农田、城区)内部相邻像素变化很小,这是物质分布连续性的直接结果;
- 真实地物边界处才出现突变。
这对应一个二维扩散方程:区域内部趋于平滑,边界处允许跳变。
动机的直接证据:梯度贡献可视化
论文用一张梯度可视化图来检验物理约束是否真的改变了少样本下的学习行为。做法是在训练结束时对输入 HSI 的每个像素计算相对梯度幅值——某点的梯度越大,说明该点对损失函数(即模型优化)的贡献越大;黑色方块标记仅有的标注训练样本位置。

图中 Standard Mamba(左)的梯度集中在标注样本周围的小邻域内,大片未标注区域几乎无梯度响应;PIMamba(右)的梯度分布范围更大且更均匀,标注点之间出现连续的梯度响应。论文据此给出的解释是:物理约束(尤其是空间扩散约束)把监督信号沿地物结构传播到了未标注区域,使模型在少样本条件下利用了更多无标签信息。这一解释与图示现象一致;其量化支撑来自后续实验中 OA 的提升,论文未进一步给出无标签区域预测质量的直接度量。
方法:物理约束进入模型的三个层面
双分支框架

框架由空间分支与光谱分支组成,两条分支使用同一种 PIMamba Block,区别只在序列的构造方式:
- 空间分支把每个像素当作序列的一个时间步(),像素的 维通道向量作为该步的特征。Mamba 沿像素序列迭代隐藏状态,聚合局部与全局空间信息,逐级平均池化降低序列长度。其特征图反映像素间依赖,用于构造空间物理约束 SpaLoss。
- 光谱分支把 个光谱通道分成 组、每组 个通道,将通道组当作序列(长度 ),让 Mamba 直接沿光谱维度建模波段间的模式。该分支全程保持通道数 不变,其特征图聚焦波段内在关系,用于构造光谱物理约束 SpeLoss。
两分支特征融合后送入分类头,与三个损失共同训练。
状态转移矩阵的物理化
Mamba 基于状态空间模型(SSM),连续形式为:
其中 是状态转移矩阵,决定了系统的传播速度、衰减行为与稳定性,在很大程度上决定模型能学到什么动态模式。原始 Mamba 中 是完全可学习的自由参数,其动力学结构完全由数据学出——样本少时不可靠。
论文的观察是:遥感图像的隐藏状态通常有很强的局部相关性,相邻像素往往共享相似的光谱与语义属性,隐藏状态的演化呈现"局部传播 + 扩散"的行为。PIMamba 据此把状态演化改写为受物理约束的连续时间系统:
其中 是离散扩散算子, 分别控制扩散强度与衰减强度。负号来自经典扩散系统 ( 半正定),保证系统总能量随时间衰减或收敛到平衡态。 的形式按分支定制:
- 光谱分支:隐藏状态沿光谱维度排列, 取一维二阶差分算子(三对角矩阵,对角线 、次对角线 ),即光谱曲线曲率的离散度量;
- 空间分支:隐藏状态对应图像平面上的空间序列, 取二维离散拉普拉斯算子,刻画相邻空间位置的耦合与传播。
连续系统经零阶保持(ZOH)离散化后得到可计算的状态更新方程:
为了保留 Mamba 的输入自适应特性,、 与时间步 由当前输入 经线性投影加 Softplus 激活动态生成,Softplus 保证物理参数恒为正。
这样,状态转移矩阵从"完全自由学习"变成"物理扩散算子决定结构 + 输入自适应决定强度"。可学习自由度降低,小样本下的稳定性随之提升——这是论文的设计意图,其有效性由后续消融与主实验间接支持。
SpeLoss:光谱维度的反应–扩散方程
将光谱反射率 视为扩散(平滑)与吸收(反应)两种机制共同作用的产物,可抽象出一维 PDE:
其中 是扩散系数(波段间平滑强度), 是反应系数(局部吸收、反射等成分变化)。二阶导数项约束光谱曲线的曲率,鼓励相邻波段连续; 项允许并刻画特定波长处的峰谷。波长离散成波段后,用有限差分近似两个导数项,得到波段 处的 PDE 残差:
最小化 即要求网络学到的特征沿光谱维度满足这条物理定律。
SpaLoss:空间维度的二维扩散方程
空间分支的损失基于同样的构造思路。像素值(反射率或特征向量)在相邻坐标上连续或准连续,仅在地物边界处显著变化,类比热量或浓度的局部平衡过程,可建模为二维扩散 PDE:
其中 、 是水平与垂直方向的扩散系数, 是源项,用于描述边界、热点等局部特征。训练时假设稳态(),在像素网格上用有限差分离散两个方向的二阶导数,得到每个像素 的残差 ,对全图求平方和即为 。
两个物理损失的输入不是原始图像,而是对应分支提取出的特征图——即物理约束监督的是网络学到的表征是否符合物理规律,属于表征层面的正则化。
DPA:动态平衡两个物理损失
总损失为:
、(以及 、、、)的取值决定监督信号与物理约束之间的平衡。PIMamba 采用基于梯度归一化(GradNorm)思想的 DPA 机制:每次迭代计算两个物理损失对网络参数 的梯度范数 、,按如下规则更新权重:
目标是使 (两损失的梯度贡献平衡),开平方用于避免两梯度差异悬殊时权重剧烈震荡, 为防止分母为零的小正数。
实验:5 样本/类设定下的结果
实验设定
- 数据集:Indian Pines(16 类,145×145,200 个有效波段)、University of Pavia(9 类,610×340,103 波段)、Salinas(16 类,512×217,204 波段)、Houston 2013(15 类,349×1905,144 波段)。
- 协议:每类随机选 5 个像素样本训练,其余全部用于测试;每个实验重复 10 次,报告均值 ± 标准差。
- 对比方法:8 个不依赖预训练或外部数据的方法——CNN 类(3DCNN、HybridSN)、Transformer 类(SpectralFormer、SSFTT、GSC-ViT)、Mamba 类(MambaHSI、S2Mamba、GraphMamba)。
- 指标:OA、AA、Kappa、mF1,以及 Params 与 FLOPs。
- 硬件:单张 RTX 4090(24 GB)。
主结果

以最困难的 Indian Pines 为例,PIMamba 在 OA、AA、Kappa、mF1 四项指标上均为最优:OA 79.79 ± 2.59%,比第二名 GraphMamba(76.23%)高 3.56 个百分点,比 MambaHSI(74.13%)高 5.66 个百分点,比 3DCNN(59.06%)高 20.73 个百分点。在 Soybean-notill、Woods 等难分类别上分别达到 77.02% 与 92.45%。UP 数据集上 PIMamba 的 OA 标准差(3.32)也小于 GraphMamba(6.8)与 S2Mamba(4.42),在该协议下稳定性更好。
定性结果方面,论文图 7–10 给出了四个数据集的分类图对比,PIMamba 的分类图区域内部一致性更高、边界更清晰。以 IP 与 Houston 为例:


消融实验
论文在四个数据集上系统消融了 SpeLoss、SpaLoss 与 DPA(表 VI),IP 数据集上的递进关系如下:
| 配置 | IP OA (%) |
|---|---|
| 仅 SpeLoss | 75.33 ± 2.59 |
| SpeLoss + DPA | 76.29 ± 3.84 |
| 仅 SpaLoss | 76.70 ± 2.73 |
| SpaLoss + DPA | 77.21 ± 3.55 |
| SpeLoss + SpaLoss | 77.96 ± 2.82 |
| 完整模型(+ DPA) | 79.79 ± 2.59 |
三点观察:
- 仅 SpeLoss(75.33%)或仅 SpaLoss(76.70%)就已超过 MambaHSI(74.13%),物理约束单独使用即有增益,且在 IP 上空间约束强于光谱约束;
- 两种损失同时使用(77.96%)高于任一单用,光谱与空间约束从不同角度正则化模型;
- DPA 在四个数据集上均为正增益(IP +1.83、UP +0.70、SA +1.18、Houston +1.77)。
跨模型泛化
为了验证物理约束不绑定 Mamba 架构,作者把 SpeLoss 与 SpaLoss 移植到 SVM、3DCNN、ViT 上(表 V):加约束后 OA 分别提升 3.87、3.06、3.26 个百分点,AA 与 Kappa 同步提高。这组实验支持"该物理约束可作为通用正则化策略"的说法,但样本仍限于 IP 数据集与同一协议。

模型复杂度
论文报告 PIMamba 参数量为 43.15k(UP)至 56.43k(IP),约为 MambaHSI 的 10%–13%;FLOPs 相比 MambaHSI 与 S2Mamba 降低约 65%–75%(如 UP 上 9.96G,为 MambaHSI 39.18G 的 25.4%)。需要说明两点边界:其一,FLOPs 在大尺寸场景上随像素数增长(Houston 上为 38.73G),并非在所有数据集上都是最低;其二,3DCNN、HybridSN 等轻量模型的 FLOPs 更低,PIMamba 的优势体现在"参数量最低 + 精度最高"的组合上。
局限与讨论
论文自述的局限有两点。第一,采用的扩散型先验是预定义的,只是对光谱–空间连续性的近似,可能无法覆盖真实场景中更复杂的物理交互;作者把自适应或可学习的物理算子列为后续方向。第二,模型对有限训练样本的选取仍敏感:IP 数据集上 Corn-mintill 类的标准差达到 13.13%,说明该类性能对"抽到哪 5 个样本"的波动较大;论文建议后续研究更稳健的采样策略或不确定性感知的训练机制。
从方法论证的角度,还有两点值得注意。其一,物理残差损失直接作用于特征图时,、 等系数与学习到的特征空间之间的对应关系缺少严格论证,这里的物理约束更接近一种有效的归纳偏置,而非严格的物理建模。其二,全部实验基于四个公开数据集与 5 样本/类协议,跨传感器、跨区域的泛化能力未在论文中验证——这恰是动机部分强调的现实场景。
与医学图像分割的关联值得一提:医学影像同样面临标注昂贵与跨中心域偏移的问题,器官边界的解剖连续性与组织信号的局部平滑性,与本文的空间扩散先验形式相似。"物理/解剖先验作为额外监督信号"的构造路径对少标注医学分割任务有参考价值,但具体收益需要在其自身任务上独立验证。
结论
PIMamba 展示了一条不依赖外部数据与预训练模型的少样本 HSI 分类路线:把高光谱成像机理中"光谱平滑 + 波段吸收"与"空间同质平滑 + 边界突变"两类规律,分别抽象为反应–扩散方程与二维扩散方程,再同时用于约束 Mamba 的结构(状态转移矩阵)与监督(残差损失)。在四个公开数据集、每类 5 个标注样本的设定下,该方法在 OA、AA、Kappa、mF1 上超过八个不依赖预训练的对比方法,参数量比 MambaHSI 低一个数量级,且物理损失移植到 SVM、3DCNN、ViT 上均有 3 个百分点以上的提升。
对后续工作的启示主要在方法构造层面:当目标任务缺少显式物理方程时,可以从领域机理出发归纳出近似的 PDE 形式,将其残差作为特征层面的正则项——这条"领域知识 → 数学形式 → 可微损失"的路径本身可迁移,其具体形式(扩散算子、反应项)需要按任务重新设计。
See also
- VAST 精读:CLIP 持续学习里,视觉分支为什么忘得比文本快 2026-09-11
- StyCona 精读:SVD 把域偏移拆成风格与内容,数据增强各打各的 2026-09-04
- PHFNet 精读:全阶段并行 CNN–Transformer,线性注意力里把弱红外目标补回来 2026-09-03
- GLCNet 精读:小波打散相干斑,全局-局部协作做真实 SAR 去斑 2026-09-02
- DCRM-ViT 精读:冻结骨干,按样本现调参数的多域视觉 Transformer 2026-08-28