DBSTP:ASD 识别为什么要先学瞬时时空耦合
论文信息
论文题目:Dual-branch spatiotemporal transformer pretraining model for ASD recognition using functional connectivity
发表 venue:Biomedical Signal Processing and Control, 2026
代码地址:https://github.com/USTBSCCE1028/DBSTP
这篇论文研究的是基于静息态功能磁共振 rsfMRI 的自闭症谱系障碍 ASD 识别。输入是随时间变化的 4D 脑活动信号,输出是被试更可能属于 ASD 还是正常对照 TC/NC。
作者提出的模型叫 DBSTP。它的核心判断很直接:
ASD 相关的脑网络异常,不一定稳定存在于整段扫描的平均相关性里,而可能藏在短时、动态、跨脑区的瞬时耦合中。

核心动机:Pearson FC 把时间变化平均掉了
传统 rsfMRI 分类流程通常是:
原始 rsfMRI
-> 按脑图谱划分 ROI
-> 每个 ROI 内体素信号取平均
-> ROI 两两计算 Pearson 相关
-> 得到静态 FC 矩阵
-> 分类器识别 ASD
这个流程的问题在于,它很早就把完整的 4D 脑活动压缩成了一张静态功能连接矩阵。Pearson 相关回答的是:
整段扫描期间,脑区 A 和脑区 B 平均来说是否同步?
但 ASD 的异常连接可能不是这种“全程稳定相关”,而是更短暂的现象:
某些脑区只在一小段时间里出现异常同步;
某些功能网络在特定时刻发生短暂重组;
某些跨脑区耦合被全程平均后反而被冲淡。
所以这篇论文并不是简单换一个分类器,而是把问题往前推到 FC 构建之前:
能不能先从原始 4D rsfMRI 中学习时空表示,再基于这种表示构造更有诊断价值的功能连接?
整体方法:先学表示,再构图,再分类
DBSTP 可以拆成三个核心模块。
第一,双分支时空 Transformer 预训练模块:直接处理原始 4D rsfMRI,分别建模空间结构和时间动态,并通过双向 cross-attention 交换信息。
第二,FC-SA 功能连接构建模块:把预训练后的 ROI 表示当成 token,用 multi-head self-attention 学习 116 × 116 的功能连接矩阵。
第三,MG-GNN 多粒度图神经网络:把 ROI 当节点、FC 当边,同时融合全局 rsfMRI 表示和年龄/性别信息,完成 ASD 二分类。
可以压缩成一条主线:
Raw 4D rsfMRI
-> Dual-branch spatiotemporal pretraining
-> Attention-based FC construction
-> Multi-granularity GNN
-> ASD / Control
模块一:双分支时空 Transformer
原始 rsfMRI 可以看成一段 3D 大脑视频:
X ∈ R^{T × H × W × D × 1}
其中 T 是时间帧数,H/W/D 是每一帧 3D 脑图像的空间尺寸。
模型先把每一帧 3D 脑体积切成 P × P × P 的 patch,再做层级式 patch merging。这里最关键的设计是:空间分辨率逐步降低,但时间维度保持完整。这避免了滑动窗口或时间平均带来的过早平滑。
之后模型从同一个表示里构造两个视角:
Spatial branch:关注同一时间点内,不同空间位置或脑区之间的关系。Temporal branch:关注同一空间位置上,BOLD 信号如何随时间变化。

这两个分支的核心交互是:
ST-MHCA:空间分支拿自己的 Query,去时间分支取 Key/Value
TS-MHCA:时间分支拿自己的 Query,去空间分支取 Key/Value
也就是:
ST-MHCA 让空间表示吸收时间动态;
TS-MHCA 让时间表示吸收空间结构。
这一步的目的,是把“某一时刻的空间连接模式”和“某一脑区的时间演化”绑定起来。这样后续构造 FC 时,输入已经不是原始平均信号,而是带有瞬时时空交互的信息。
模块二:用 self-attention 构造 FC
前一个模块输出预训练后的 rsfMRI feature:
X_fMRI ∈ R^{B × H × W × D × T}
然后作者使用 AAL atlas 把大脑划分为 116 个 ROI。对每个 ROI,在对应区域内取体素激活平均,得到 ROI 时间序列:
X_ROI ∈ R^{B × T × 116}
传统做法会直接对这些 ROI 时间序列计算 Pearson 相关。DBSTP 则把每个 ROI 当成一个 token,用 Transformer encoder 在 ROI 维度上做 self-attention。
每一层、每个 head 都会得到一个注意力矩阵:
A^{l,h} ∈ R^{116 × 116}
矩阵中的 A_{i,j} 表示:ROI i 在更新自身表示时,对 ROI j 的依赖强度。作者把所有层和所有 head 的 attention 权重平均,得到最终的 FC-SA 矩阵。
这和 Pearson FC 的差异很关键:
| 方法 | 连接含义 | 是否可学习 | 表达关系 |
|---|---|---|---|
| Pearson FC | 两个 ROI 时间序列的线性相关 | 否 | 静态、线性、全程平均 |
| FC-SA | ROI token 之间的信息依赖 | 是 | 非线性、由任务驱动、继承时空表示 |
所以 FC-SA 不只是换了一个相关系数,而是把功能连接构建变成了一个可学习的表示问题。
模块三:MG-GNN 做多粒度分类
有了 116 × 116 的 FC 矩阵后,论文把每个被试的大脑建成一张图:
节点:116 个 ROI
边权重:FC-SA 得到的功能连接强度
节点特征:ROI 时间序列活动
MG-GNN 在这张脑图上做信息传播。它不是只看直接相邻节点,还引入了基于最短路径的距离感知传播,让信息可以在更高阶的脑网络结构中流动。
最后,模型融合三类信息:
h_GNN:图网络学到的 ROI-连接结构
X_BOLD_global:全局 rsfMRI embedding
X_demo:年龄和性别信息
融合后的表示进入全连接层和 sigmoid,输出 ASD 概率。
这也是模型名里 Multi-Granularity 的含义:它同时看局部 ROI 活动、脑网络连接、全局 BOLD 动态和人口学变量。
训练策略:预训练、冻结、再微调
训练分为三步。
第一步,在 ABIDE II 上预训练双分支时空 Transformer,学习通用 rsfMRI 时空表示。
第二步,迁移到 ABIDE I 做 ASD 分类时,先冻结预训练 Transformer,只训练 FC-SA 和 MG-GNN。这样可以让连接构建和分类器先适应稳定的表示空间。
第三步,等下游模块收敛后,解冻整个框架,在 ABIDE I 上端到端微调。
这个策略的目的很明确:医学影像样本量有限,直接从零训练完整时空 Transformer 容易不稳定。预训练提供一个更好的初始化,冻结阶段降低过拟合风险,最后微调让表示适配 ASD 分类目标。
实验结果:整体性能优于多数 baseline
论文在 ABIDE I 上做 ASD/HC 二分类,数据规模为:
总人数:1112
ASD:539
TC:573
站点:17
训练使用 Adam,学习率 1e-4,batch size 16,训练 100 epochs,评价指标包括 ACC/PRE/REC/F1/AUC。

主结果如下:
| 方法 | ACC | F1 | AUC |
|---|---|---|---|
| SFGL | 68.10 | 71.90 | 71.80 |
| CI-GNN | 71.00 | 72.00 | 71.82 |
| RGTNet | 73.40 | 71.55 | 72.30 |
| RM-DRL | 76.09 | 73.27 | 77.43 |
| CcSi-MHAH | 78.54 | 77.03 | 87.12 |
| A-GCL | 80.65 | 81.14 | 81.42 |
| DBSTP | 86.24 | 87.12 | 86.85 |
DBSTP 在 ACC/PRE/REC/F1 上都是最高。AUC 上需要注意一个细节:CcSi-MHAH 的 87.12 略高于 DBSTP 的 86.85,所以 DBSTP 不是每个单项都压倒性第一,但整体分类表现更均衡。
和最强的整体 baseline A-GCL 相比,DBSTP 的准确率提升约 5.59 个百分点。作者认为这主要来自三个因素的叠加:
时空预训练
+ attention-based FC 构建
+ 图网络多粒度融合
FC 构建方式对比:FC-SA 是关键
为了证明 FC-SA 不是可有可无的模块,作者固定预训练表示和 MG-GNN,只替换 FC 构建方式。
| FC 构建方法 | ACC | F1 | AUC |
|---|---|---|---|
| sCBF | 78.34 | 78.03 | 78.65 |
| CausalLag | 79.11 | 78.96 | 79.83 |
| Ensemble | 82.27 | 82.23 | 83.20 |
| RGTNet-FC | 83.12 | 83.10 | 84.01 |
| FC-SA | 86.24 | 87.12 | 86.85 |
这个结果说明:即使后面的分类器不变,FC 是怎么构造的也会显著影响性能。FC-SA 的优势不是单纯来自 attention,而是来自“预训练时空表示 + attention 构图”的组合。
消融实验:哪个模块最重要
论文设计了三个变体:
DBSTP-A:去掉双分支时空 Transformer 预训练,直接用 raw rsfMRI
DBSTP-B:把 FC-SA 换成传统 Pearson correlation
DBSTP-C:把 MG-GNN 换成普通全连接融合
| 模型 | ACC | F1 | AUC |
|---|---|---|---|
| DBSTP-A | 78.43 | 78.13 | 78.90 |
| DBSTP-B | 79.68 | 79.38 | 80.21 |
| DBSTP-C | 82.45 | 82.39 | 83.02 |
| DBSTP | 86.24 | 87.12 | 86.85 |
这里最值得注意的是:去掉预训练和替换 FC-SA 的下降最大。也就是说,这篇论文最核心的贡献不是最后的图分类器,而是前面两个步骤:
先学习时空表示;
再从这个表示里学习功能连接。
MG-GNN 也有贡献,但相对而言,它更像是把已有高质量 FC 和多粒度特征组织起来的下游分类模块。
FC 可视化:FC-SA 更稀疏,也更个体化
作者比较了 FC-SA 和 Pearson correlation 生成的功能连接矩阵。

图中:
(a) FC-SA 的 ASD 样本
(b) FC-SA 的正常对照样本
(c) Pearson 的 ASD 样本
(d) Pearson 的正常对照样本
可以看到,Pearson FC 更均匀,很多区域之间都有中等强度相关;FC-SA 更稀疏,强连接集中在少数子网络中。
作者的解释是:Pearson 通过全程平均,把很多短时强耦合摊薄了;FC-SA 则更容易突出短暂但有诊断价值的连接模式。
论文还用三个指标比较 FC 的可靠性和个体区分性:

根据讨论部分的总结,FC-SA 相比 Pearson:
ICC:0.43 -> 0.52
Differential identifiability:0.18 -> 0.30
Fingerprint hit rate:34% -> 57%
这说明 FC-SA 生成的脑网络不仅更稀疏,也更稳定、更能区分个体。
统计分析:模型确实在看瞬时耦合
作者进一步问了一个关键问题:
DBSTP 的 attention 是否真的对应动态功能连接变化,而不是只是另一个静态相关矩阵?
他们用滑动窗口动态 FC 作为参照,检验时空 attention 和动态 FC 波动之间的对齐程度。结果是:
grand mean Fisher z = 0.31
p < 0.001
FDR 后 4384 / 6670 条边仍显著
其中 71.4% 位于默认模式网络和额顶网络内部或二者之间
相反,如果把 attention 也做时间平均,对齐关系就消失了:
z = 0.04
p = 0.48
这个结果支持了论文最核心的论点:DBSTP 不是只学到静态相关,而是在利用 moment-to-moment 的瞬时耦合信息。

Biomarker:模型关注哪些脑区
最后,作者基于正确分类的 ASD 样本做可解释性分析,统计 ROI 和 FC 的贡献。

Top 10 ROI 包括:
| ROI | 缩写 |
|---|---|
| Precuneus_R | PCUN.R |
| Cingulum_Ant_R | ACG.R |
| Lingual_L | LING.L |
| Temporal_Inf_L | ITG.L |
| Frontal_Sup_Medial_R | SFGmed.R |
| Hippocampus_R | HIP.R |
| Cerebelum_9_L | CRBL9.L |
| Temporal_Pole_Mid_R | TPOmid.R |
| Frontal_Mid_Orb_L | ORBsupmed.L |
| Frontal_Inf_Oper_R | IFGoperc.R |
这些区域主要落在几个和 ASD 研究高度相关的系统里:
- 默认模式网络:例如 precuneus。
- 额顶控制系统:例如 anterior cingulate、medial frontal 区域。
- 颞叶感知和语义处理网络:例如 inferior temporal gyrus、temporal pole。
- 边缘系统和小脑相关区域:例如 hippocampus、cerebellar lobule IX。
这让模型的可解释性更可信:它不是只找到一组纯数据驱动的统计模式,而是和已有 ASD 神经影像研究中的关键脑区有一定一致性。
这篇论文真正值得记住的地方
这篇论文最重要的点,不是“又用了 Transformer 和 GNN”,而是它重新组织了 rsfMRI 分类的前处理逻辑。
传统流程通常是:
先用固定统计方法构造 FC
再让模型基于 FC 分类
DBSTP 的流程是:
先用模型学习 4D rsfMRI 的时空表示
再从表示里学习 FC
最后用图网络分类
这实际上把 FC 从一个固定输入,变成了一个可学习的中间表示。对于 ASD 这种高度异质、动态脑网络异常明显的任务,这个思路是合理的。
如果要压缩成一句话:
DBSTP 的贡献,是用时空预训练和 attention-based FC,把 ASD 识别从“静态相关矩阵分类”推进到“瞬时时空耦合建模”。
局限与可以继续追的问题
论文也有几个值得注意的限制。
第一,ROI 划分固定使用 AAL atlas。不同 atlas 可能会改变 FC 结构和 biomarker 解释,后续需要比较 CC200、HO 或多 atlas 融合。
第二,模型只使用 rsfMRI。ASD 的脑网络异常也可能体现在结构连接或形态连接上,未来可以融合 DTI、结构 MRI 或形态连接。
第三,当前更偏 intra-subject 建模,也就是每个被试内部的脑网络。ASD 异质性很强,如果引入 population graph、症状量表或亚型聚类,可能更适合做个体化诊断。
第四,论文声称 FC-SA 更可解释,但 attention 权重是否能完全等同于神经生理意义上的连接强度,仍然需要谨慎。这里更稳妥的说法是:FC-SA 给出了一个和动态 FC、已知脑区系统具有统计一致性的模型解释。
我的总结
DBSTP 是一篇结构完整、动机清楚的 rsfMRI ASD 识别论文。它的强点在于:没有把重点只放在最后的分类器,而是从功能连接构建这一步重新设计。
我认为这篇文章最有价值的启发是:
在脑疾病分类里,FC 不一定只能是 Pearson 相关矩阵;
它也可以是一个由时空表征学习驱动的、任务相关的可学习脑网络。
这对后续做 fMRI、脑网络 GNN 或医学影像预训练都有参考价值。尤其是当疾病信号可能表现为短时动态耦合,而不是稳定静态差异时,直接从原始 4D 数据中学习表示,可能比先手工压成静态矩阵更合适。
注:本文图片均来自论文原图裁剪,仅用于论文阅读笔记与方法解析。若用于公开发布,请按原论文版权要求确认配图使用权限。
See also
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割 2026-07-26
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23
- TG-HEM:用拓扑困难样本挖掘改进拥挤病理细胞检测 2026-07-22