PRISMamba 论文精读:用环形扫描重新思考 Vision SSM 的序列顺序
论文信息
论文题目:Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
论文地址:arXiv:2602.04170
关键词:Vision SSM、Mamba、scan order、rotation robustness、channel filtering
这篇论文讨论的不是如何再堆叠一个更复杂的 Vision Mamba block,而是一个经常被忽略的问题:二维图像究竟应该以什么顺序送入一维 SSM?
作者的观点很直接:扫描顺序会决定 SSM 在递推时把哪些空间位置当作“相邻”。因此,它既影响准确率,也决定模型面对旋转时是否稳定。
先说结论
PRISMamba 做了两件事:
- 用 Ring Scan 将特征图按到中心的距离划为同心环,在环内聚合、在环间由内向外传播;
- 用 Partial Channel Filtering(PCF) 只让高显著性通道经过较贵的环形递归路径,其余通道走残差旁路。
作者报告,在 ImageNet-1K 上,PRISMamba 达到 84.5% Top-1、3.9G FLOPs、3054 img/s;对比 VMamba 的 82.6%、5.6G、1686 img/s,同时更准、更省计算且更快。
但这篇工作的最强证据并不是单一的 ImageNet 数字,而是旋转测试:固定路径 Vision Mamba 在 30 度和 60 度旋转下普遍下降约 1-2 个百分点,而 PRISMamba 基本保持不变。
动机:扫描顺序不是无关紧要的实现细节

Mamba/SSM 原本处理的是序列。其基本递推可以写成:
其中 会携带前一个 token 的状态。因此,视觉模型把二维特征图展开为一维序列时,路径本身会改变信息流。
常见的 raster、serpentine 或对角线扫描隐含了一个假设:相邻 token 大致仍对应相邻 patch。图像未变换时,这个假设通常还成立;图像旋转后,padding 和全局重编号会改变序列邻接关系。原本连续的物体区域,可能在递推路径上被无关背景插开。
图 1 左侧展示的正是这个问题。作者希望保留“相近半径的区域可以一起被处理”的结构,而不是绑定某一条固定的全局路径。
方法概览:两级环扫描加一个通道筛选器

可以把一个 PRISM block 压缩成下面这条数据流:
二维特征图
-> PCF:分出高显著性通道与残差通道
-> 环内 SSM:每个同心环各自递推
-> 环描述符:环内输出取平均
-> 径向 SSM:由内环向外环传播
-> 广播回二维网格
-> 1x1 投影与残差融合
它并没有把整张图转换成极坐标图,也没有把整张图沿一条超长螺旋路径扫完。核心是:先把每个环压缩成一个描述符,再让这些环描述符形成一条短的内到外序列。
第一步:按半径划分同心环
对特征图中的位置 ,设中心为 ,环宽为 。论文按距离离散化环编号:
例如一个 网格,以中心 分环,粗略可写作:
2 1 1 2
1 0 0 1
1 0 0 1
2 1 1 2
中心的四个位置属于环 0,边缘的大部分位置属于环 1,四个角属于环 2。实际实现中,这些位置索引可在每个 stage 的分辨率下预先计算并缓存;若已有目标检测器,作者还允许用目标中心替代图像中心,使环划分更具对象感知性。
第二步:环内递推并压缩成环描述符

每个环 形成一个长度为 的闭环序列。相邻环交替顺时针和逆时针遍历:奇数环顺时针,偶数环逆时针。对环内 token 运行短 SSM:
随后取平均:
这里有一个容易误解的细节。论文称其使用了 order-agnostic aggregation,但这不代表环内 SSM 完全不受顺序影响:递推仍有方向。更准确地说,环内输出的平均降低了起点和局部顺序对最终环描述符的影响,而交替方向则进一步减弱固定方向偏置。
旋转时,像素通常仍属于同一半径环;环内位置大多只是循环移位。因此,模型避免了固定路径在旋转后发生的全局邻接关系断裂。
第三步:用第二个 SSM 在环之间传播
得到的 是一条从中心到边缘的短序列。论文再使用径向 SSM:
因此模型有两个层次:
- 环内 SSM 处理同半径上的局部连续性;
- 径向 SSM 建模从主体中心到外围背景的跨环上下文。
最终,属于环 的每个像素都会得到该环的 ,通过 投影写回网格,再和原始特征做残差融合:
这一步很重要。环级输出会在同一环内共享,天然缺少细粒度角度信息;残差分支保留了原始空间细节,不让环聚合直接覆盖局部特征。
PCF:把递归计算优先花在高显著性通道上
在进入 Ring Scan 前,PCF 先对每个通道做全局平均池化:
当 时,该通道进入环形递归路径;否则进入残差旁路。它与 SE、CBAM 的关键差别是:SE/CBAM 通常对所有通道加权后仍继续计算,而 PCF 旨在真正绕开一部分昂贵的递归更新。
这也是论文能同时提升吞吐和准确率的核心假设:低显著性通道仍被残差保留,但不会占用环扫描的主要计算预算。
实验一:ImageNet 上同时提高准确率与吞吐

表 1 中最重要的不是只比较 PRISMamba 和 VMamba,还包括 PRISMamba 自己的消融:
PRISMamba (w/o PCF):27M参数、4.6GFLOPs、2177 img/s、84.1%;PRISMamba:22M参数、3.9GFLOPs、3054 img/s、84.5%。
启用 PCF 后,FLOPs 减少约 15%,吞吐提升约 40%,Top-1 还增加了 0.4 个百分点。这个结果支持 PCF 并非只是在剪掉计算,也可能降低了环描述符中的冗余噪声。
吞吐量需谨慎解读:论文仅在 Nvidia A100 上报告,实际部署速度仍会受 kernel、批量大小和硬件影响。
实验二:旋转鲁棒性是最直接的验证

作者在同一画布上测试 、 和 的旋转。60 度时:
VMamba:82.6 -> 80.6,下降2.0;GroupMamba:83.9 -> 82.0,下降1.9;PRISMamba (w/o PCF):84.1 -> 83.9,下降0.2;PRISMamba:84.5 -> 84.4,下降0.1。
这组实验最贴合论文的机制主张:固定路径对旋转敏感,而同心环的成员关系更稳定。
不过,这并不等于模型对所有几何变换都天然不变。论文只评估了两种旋转角度;平移、缩放、极端长宽比,以及中心估计错误仍是开放问题。
实验三:COCO 检测与实例分割

在 COCO mini-val、Mask R-CNN、1x schedule、输入 1280\times800 的条件下:
PRISMamba:235GFLOPs、48.9 AP^box、43.2 AP^mask;VMamba:262GFLOPs、46.5 AP^box、42.1 AP^mask;GroupMamba:279GFLOPs、47.6 AP^box、42.9 AP^mask。
PRISMamba 不仅在宽松匹配阈值上领先, 也高于 GroupMamba 的 52.1 和 DefMamba 的 51.7。这说明其收益不只是增加召回,还可能改善边界定位。
消融:为什么硬路由比软注意力更有效

在相同 PRISMamba backbone 上:
- 加
SE:Top-1 从84.1%到84.2%,FLOPs 不变,吞吐从2177降到2089 img/s; - 加
CBAM:Top-1 到84.3%,参数增加,吞吐降到1982 img/s; - 加
PCF:Top-1 到84.5%,参数从27M降到22M,FLOPs 从4.6G降到3.9G,吞吐升到3054 img/s。
这张表支持的不是“硬筛选永远优于注意力”,而是针对后续存在递归计算的环扫描模块,真正减少进入该模块的通道数,比给全部通道赋软权重更符合效率目标。
优点与局限
这篇工作的优点很集中:
- 抓住了 Vision SSM 中扫描顺序这一基础但常被忽略的设计变量;
- 方法结构清晰,环内聚合、径向传播和 PCF 的分工明确;
- 有准确率、吞吐、旋转、遮挡、检测与分割等多维证据;
- PCF 同时有移除模块、跨骨干插入和 SE/CBAM 的对照实验。
边界也同样清楚:
- 当前实现依赖固定图像中心和离散环宽,对偏心目标或极端长宽比可能不是最优;
- 严重旋转带来的 padding 仍会减少有效图像信息;
- 吞吐量只在 A100 上报告;
- 论文写明代码将在接收后发布,因此动态 PCF 的 batch 级实现细节尚无法直接复核。
总结
PRISMamba 最值得记住的结论是:对 Vision SSM 而言,扫描顺序就是模型结构的一部分。
固定路径把二维关系强行绑定到一维遍历方向;环扫描将这种关系改写为“同半径聚合、由内到外传播”。再配合将计算集中于高显著性通道的 PCF,论文展示了一个同时改善准确率、效率与旋转稳定性的方案。
它不是让视觉模型获得严格的旋转不变性,而是用更匹配图像几何的序列化方式,显著降低固定扫描路径带来的脆弱性。
See also
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割 2026-07-26
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23
- TG-HEM:用拓扑困难样本挖掘改进拥挤病理细胞检测 2026-07-22