PRISMamba 论文精读:用环形扫描重新思考 Vision SSM 的序列顺序

Date 2026-07-19 · Category tech · Status finished · Confidence likely
论文解读, 视觉 Mamba, 状态空间模型

论文信息

论文题目:Partial Ring Scan: Revisiting Scan Order in Vision State Space Models

论文地址:arXiv:2602.04170

关键词:Vision SSMMambascan orderrotation robustnesschannel filtering

这篇论文讨论的不是如何再堆叠一个更复杂的 Vision Mamba block,而是一个经常被忽略的问题:二维图像究竟应该以什么顺序送入一维 SSM?

作者的观点很直接:扫描顺序会决定 SSM 在递推时把哪些空间位置当作“相邻”。因此,它既影响准确率,也决定模型面对旋转时是否稳定。


先说结论

PRISMamba 做了两件事:

  • Ring Scan 将特征图按到中心的距离划为同心环,在环内聚合、在环间由内向外传播;
  • Partial Channel Filtering(PCF) 只让高显著性通道经过较贵的环形递归路径,其余通道走残差旁路。

作者报告,在 ImageNet-1K 上,PRISMamba 达到 84.5% Top-1、3.9G FLOPs、3054 img/s;对比 VMamba 的 82.6%5.6G1686 img/s,同时更准、更省计算且更快。

但这篇工作的最强证据并不是单一的 ImageNet 数字,而是旋转测试:固定路径 Vision Mamba 在 30 度和 60 度旋转下普遍下降约 1-2 个百分点,而 PRISMamba 基本保持不变。


动机:扫描顺序不是无关紧要的实现细节

固定路径扫描与环形扫描

Mamba/SSM 原本处理的是序列。其基本递推可以写成:

其中 会携带前一个 token 的状态。因此,视觉模型把二维特征图展开为一维序列时,路径本身会改变信息流。

常见的 raster、serpentine 或对角线扫描隐含了一个假设:相邻 token 大致仍对应相邻 patch。图像未变换时,这个假设通常还成立;图像旋转后,padding 和全局重编号会改变序列邻接关系。原本连续的物体区域,可能在递推路径上被无关背景插开。

图 1 左侧展示的正是这个问题。作者希望保留“相近半径的区域可以一起被处理”的结构,而不是绑定某一条固定的全局路径。


方法概览:两级环扫描加一个通道筛选器

PRISMamba 的整体架构

可以把一个 PRISM block 压缩成下面这条数据流:

二维特征图
  -> PCF:分出高显著性通道与残差通道
  -> 环内 SSM:每个同心环各自递推
  -> 环描述符:环内输出取平均
  -> 径向 SSM:由内环向外环传播
  -> 广播回二维网格
  -> 1x1 投影与残差融合

它并没有把整张图转换成极坐标图,也没有把整张图沿一条超长螺旋路径扫完。核心是:先把每个环压缩成一个描述符,再让这些环描述符形成一条短的内到外序列。


第一步:按半径划分同心环

对特征图中的位置 ,设中心为 ,环宽为 。论文按距离离散化环编号:

例如一个 网格,以中心 分环,粗略可写作:

2 1 1 2
1 0 0 1
1 0 0 1
2 1 1 2

中心的四个位置属于环 0,边缘的大部分位置属于环 1,四个角属于环 2。实际实现中,这些位置索引可在每个 stage 的分辨率下预先计算并缓存;若已有目标检测器,作者还允许用目标中心替代图像中心,使环划分更具对象感知性。


第二步:环内递推并压缩成环描述符

环扫描的顺序

每个环 形成一个长度为 的闭环序列。相邻环交替顺时针和逆时针遍历:奇数环顺时针,偶数环逆时针。对环内 token 运行短 SSM:

随后取平均:

这里有一个容易误解的细节。论文称其使用了 order-agnostic aggregation,但这不代表环内 SSM 完全不受顺序影响:递推仍有方向。更准确地说,环内输出的平均降低了起点和局部顺序对最终环描述符的影响,而交替方向则进一步减弱固定方向偏置。

旋转时,像素通常仍属于同一半径环;环内位置大多只是循环移位。因此,模型避免了固定路径在旋转后发生的全局邻接关系断裂。


第三步:用第二个 SSM 在环之间传播

得到的 是一条从中心到边缘的短序列。论文再使用径向 SSM:

因此模型有两个层次:

  • 环内 SSM 处理同半径上的局部连续性;
  • 径向 SSM 建模从主体中心到外围背景的跨环上下文。

最终,属于环 的每个像素都会得到该环的 ,通过 投影写回网格,再和原始特征做残差融合:

这一步很重要。环级输出会在同一环内共享,天然缺少细粒度角度信息;残差分支保留了原始空间细节,不让环聚合直接覆盖局部特征。


PCF:把递归计算优先花在高显著性通道上

在进入 Ring Scan 前,PCF 先对每个通道做全局平均池化:

时,该通道进入环形递归路径;否则进入残差旁路。它与 SE、CBAM 的关键差别是:SE/CBAM 通常对所有通道加权后仍继续计算,而 PCF 旨在真正绕开一部分昂贵的递归更新。

这也是论文能同时提升吞吐和准确率的核心假设:低显著性通道仍被残差保留,但不会占用环扫描的主要计算预算。


实验一:ImageNet 上同时提高准确率与吞吐

ImageNet-1K 的准确率、计算量和吞吐比较

表 1 中最重要的不是只比较 PRISMamba 和 VMamba,还包括 PRISMamba 自己的消融:

  • PRISMamba (w/o PCF)27M 参数、4.6G FLOPs、2177 img/s84.1%
  • PRISMamba22M 参数、3.9G FLOPs、3054 img/s84.5%

启用 PCF 后,FLOPs 减少约 15%,吞吐提升约 40%,Top-1 还增加了 0.4 个百分点。这个结果支持 PCF 并非只是在剪掉计算,也可能降低了环描述符中的冗余噪声。

吞吐量需谨慎解读:论文仅在 Nvidia A100 上报告,实际部署速度仍会受 kernel、批量大小和硬件影响。


实验二:旋转鲁棒性是最直接的验证

不同模型的旋转压力测试

作者在同一画布上测试 的旋转。60 度时:

  • VMamba82.6 -> 80.6,下降 2.0
  • GroupMamba83.9 -> 82.0,下降 1.9
  • PRISMamba (w/o PCF)84.1 -> 83.9,下降 0.2
  • PRISMamba84.5 -> 84.4,下降 0.1

这组实验最贴合论文的机制主张:固定路径对旋转敏感,而同心环的成员关系更稳定。

不过,这并不等于模型对所有几何变换都天然不变。论文只评估了两种旋转角度;平移、缩放、极端长宽比,以及中心估计错误仍是开放问题。


实验三:COCO 检测与实例分割

COCO mini-val 的检测与实例分割结果

在 COCO mini-val、Mask R-CNN、1x schedule、输入 1280\times800 的条件下:

  • PRISMamba235G FLOPs、48.9 AP^box43.2 AP^mask
  • VMamba262G FLOPs、46.5 AP^box42.1 AP^mask
  • GroupMamba279G FLOPs、47.6 AP^box42.9 AP^mask

PRISMamba 不仅在宽松匹配阈值上领先, 也高于 GroupMamba 的 52.1 和 DefMamba 的 51.7。这说明其收益不只是增加召回,还可能改善边界定位。


消融:为什么硬路由比软注意力更有效

PCF、SE 和 CBAM 的比较

在相同 PRISMamba backbone 上:

  • SE:Top-1 从 84.1%84.2%,FLOPs 不变,吞吐从 2177 降到 2089 img/s
  • CBAM:Top-1 到 84.3%,参数增加,吞吐降到 1982 img/s
  • PCF:Top-1 到 84.5%,参数从 27M 降到 22M,FLOPs 从 4.6G 降到 3.9G,吞吐升到 3054 img/s

这张表支持的不是“硬筛选永远优于注意力”,而是针对后续存在递归计算的环扫描模块,真正减少进入该模块的通道数,比给全部通道赋软权重更符合效率目标。


优点与局限

这篇工作的优点很集中:

  • 抓住了 Vision SSM 中扫描顺序这一基础但常被忽略的设计变量;
  • 方法结构清晰,环内聚合、径向传播和 PCF 的分工明确;
  • 有准确率、吞吐、旋转、遮挡、检测与分割等多维证据;
  • PCF 同时有移除模块、跨骨干插入和 SE/CBAM 的对照实验。

边界也同样清楚:

  • 当前实现依赖固定图像中心和离散环宽,对偏心目标或极端长宽比可能不是最优;
  • 严重旋转带来的 padding 仍会减少有效图像信息;
  • 吞吐量只在 A100 上报告;
  • 论文写明代码将在接收后发布,因此动态 PCF 的 batch 级实现细节尚无法直接复核。

总结

PRISMamba 最值得记住的结论是:对 Vision SSM 而言,扫描顺序就是模型结构的一部分。

固定路径把二维关系强行绑定到一维遍历方向;环扫描将这种关系改写为“同半径聚合、由内到外传播”。再配合将计算集中于高显著性通道的 PCF,论文展示了一个同时改善准确率、效率与旋转稳定性的方案。

它不是让视觉模型获得严格的旋转不变性,而是用更匹配图像几何的序列化方式,显著降低固定扫描路径带来的脆弱性。


See also