DBSTP:ASD 识别为什么要先学瞬时时空耦合

Date 2026-05-19 · Category tech · Status finished · Confidence likely
论文解读, 医学影像, 脑网络

论文信息

论文题目:Dual-branch spatiotemporal transformer pretraining model for ASD recognition using functional connectivity

发表 venue:Biomedical Signal Processing and Control, 2026

代码地址:https://github.com/USTBSCCE1028/DBSTP

这篇论文研究的是基于静息态功能磁共振 rsfMRI 的自闭症谱系障碍 ASD 识别。输入是随时间变化的 4D 脑活动信号,输出是被试更可能属于 ASD 还是正常对照 TC/NC

作者提出的模型叫 DBSTP。它的核心判断很直接:

ASD 相关的脑网络异常,不一定稳定存在于整段扫描的平均相关性里,而可能藏在短时、动态、跨脑区的瞬时耦合中。

DBSTP 整体框架,图源:论文原图裁剪


核心动机:Pearson FC 把时间变化平均掉了

传统 rsfMRI 分类流程通常是:

原始 rsfMRI
-> 按脑图谱划分 ROI
-> 每个 ROI 内体素信号取平均
-> ROI 两两计算 Pearson 相关
-> 得到静态 FC 矩阵
-> 分类器识别 ASD

这个流程的问题在于,它很早就把完整的 4D 脑活动压缩成了一张静态功能连接矩阵。Pearson 相关回答的是:

整段扫描期间,脑区 A 和脑区 B 平均来说是否同步?

但 ASD 的异常连接可能不是这种“全程稳定相关”,而是更短暂的现象:

某些脑区只在一小段时间里出现异常同步;
某些功能网络在特定时刻发生短暂重组;
某些跨脑区耦合被全程平均后反而被冲淡。

所以这篇论文并不是简单换一个分类器,而是把问题往前推到 FC 构建之前

能不能先从原始 4D rsfMRI 中学习时空表示,再基于这种表示构造更有诊断价值的功能连接?


整体方法:先学表示,再构图,再分类

DBSTP 可以拆成三个核心模块。

第一,双分支时空 Transformer 预训练模块:直接处理原始 4D rsfMRI,分别建模空间结构和时间动态,并通过双向 cross-attention 交换信息。

第二,FC-SA 功能连接构建模块:把预训练后的 ROI 表示当成 token,用 multi-head self-attention 学习 116 × 116 的功能连接矩阵。

第三,MG-GNN 多粒度图神经网络:把 ROI 当节点、FC 当边,同时融合全局 rsfMRI 表示和年龄/性别信息,完成 ASD 二分类。

可以压缩成一条主线:

Raw 4D rsfMRI
-> Dual-branch spatiotemporal pretraining
-> Attention-based FC construction
-> Multi-granularity GNN
-> ASD / Control

模块一:双分支时空 Transformer

原始 rsfMRI 可以看成一段 3D 大脑视频:

X ∈ R^{T × H × W × D × 1}

其中 T 是时间帧数,H/W/D 是每一帧 3D 脑图像的空间尺寸。

模型先把每一帧 3D 脑体积切成 P × P × P 的 patch,再做层级式 patch merging。这里最关键的设计是:空间分辨率逐步降低,但时间维度保持完整。这避免了滑动窗口或时间平均带来的过早平滑。

之后模型从同一个表示里构造两个视角:

  • Spatial branch:关注同一时间点内,不同空间位置或脑区之间的关系。
  • Temporal branch:关注同一空间位置上,BOLD 信号如何随时间变化。

空间分支与时间分支的双向交互,图源:论文原图裁剪

这两个分支的核心交互是:

ST-MHCA:空间分支拿自己的 Query,去时间分支取 Key/Value
TS-MHCA:时间分支拿自己的 Query,去空间分支取 Key/Value

也就是:

ST-MHCA 让空间表示吸收时间动态;
TS-MHCA 让时间表示吸收空间结构。

这一步的目的,是把“某一时刻的空间连接模式”和“某一脑区的时间演化”绑定起来。这样后续构造 FC 时,输入已经不是原始平均信号,而是带有瞬时时空交互的信息。


模块二:用 self-attention 构造 FC

前一个模块输出预训练后的 rsfMRI feature:

X_fMRI ∈ R^{B × H × W × D × T}

然后作者使用 AAL atlas 把大脑划分为 116 个 ROI。对每个 ROI,在对应区域内取体素激活平均,得到 ROI 时间序列:

X_ROI ∈ R^{B × T × 116}

传统做法会直接对这些 ROI 时间序列计算 Pearson 相关。DBSTP 则把每个 ROI 当成一个 token,用 Transformer encoder 在 ROI 维度上做 self-attention。

每一层、每个 head 都会得到一个注意力矩阵:

A^{l,h} ∈ R^{116 × 116}

矩阵中的 A_{i,j} 表示:ROI i 在更新自身表示时,对 ROI j 的依赖强度。作者把所有层和所有 head 的 attention 权重平均,得到最终的 FC-SA 矩阵。

这和 Pearson FC 的差异很关键:

方法 连接含义 是否可学习 表达关系
Pearson FC 两个 ROI 时间序列的线性相关 静态、线性、全程平均
FC-SA ROI token 之间的信息依赖 非线性、由任务驱动、继承时空表示

所以 FC-SA 不只是换了一个相关系数,而是把功能连接构建变成了一个可学习的表示问题。


模块三:MG-GNN 做多粒度分类

有了 116 × 116 的 FC 矩阵后,论文把每个被试的大脑建成一张图:

节点:116 个 ROI
边权重:FC-SA 得到的功能连接强度
节点特征:ROI 时间序列活动

MG-GNN 在这张脑图上做信息传播。它不是只看直接相邻节点,还引入了基于最短路径的距离感知传播,让信息可以在更高阶的脑网络结构中流动。

最后,模型融合三类信息:

h_GNN:图网络学到的 ROI-连接结构
X_BOLD_global:全局 rsfMRI embedding
X_demo:年龄和性别信息

融合后的表示进入全连接层和 sigmoid,输出 ASD 概率。

这也是模型名里 Multi-Granularity 的含义:它同时看局部 ROI 活动、脑网络连接、全局 BOLD 动态和人口学变量。


训练策略:预训练、冻结、再微调

训练分为三步。

第一步,在 ABIDE II 上预训练双分支时空 Transformer,学习通用 rsfMRI 时空表示。

第二步,迁移到 ABIDE I 做 ASD 分类时,先冻结预训练 Transformer,只训练 FC-SAMG-GNN。这样可以让连接构建和分类器先适应稳定的表示空间。

第三步,等下游模块收敛后,解冻整个框架,在 ABIDE I 上端到端微调。

这个策略的目的很明确:医学影像样本量有限,直接从零训练完整时空 Transformer 容易不稳定。预训练提供一个更好的初始化,冻结阶段降低过拟合风险,最后微调让表示适配 ASD 分类目标。


实验结果:整体性能优于多数 baseline

论文在 ABIDE I 上做 ASD/HC 二分类,数据规模为:

总人数:1112
ASD:539
TC:573
站点:17

训练使用 Adam,学习率 1e-4,batch size 16,训练 100 epochs,评价指标包括 ACC/PRE/REC/F1/AUC

ROC 曲线与训练/验证 loss,图源:论文原图裁剪

主结果如下:

方法 ACC F1 AUC
SFGL 68.10 71.90 71.80
CI-GNN 71.00 72.00 71.82
RGTNet 73.40 71.55 72.30
RM-DRL 76.09 73.27 77.43
CcSi-MHAH 78.54 77.03 87.12
A-GCL 80.65 81.14 81.42
DBSTP 86.24 87.12 86.85

DBSTP 在 ACC/PRE/REC/F1 上都是最高。AUC 上需要注意一个细节:CcSi-MHAH87.12 略高于 DBSTP 的 86.85,所以 DBSTP 不是每个单项都压倒性第一,但整体分类表现更均衡。

和最强的整体 baseline A-GCL 相比,DBSTP 的准确率提升约 5.59 个百分点。作者认为这主要来自三个因素的叠加:

时空预训练
+ attention-based FC 构建
+ 图网络多粒度融合

FC 构建方式对比:FC-SA 是关键

为了证明 FC-SA 不是可有可无的模块,作者固定预训练表示和 MG-GNN,只替换 FC 构建方式。

FC 构建方法 ACC F1 AUC
sCBF 78.34 78.03 78.65
CausalLag 79.11 78.96 79.83
Ensemble 82.27 82.23 83.20
RGTNet-FC 83.12 83.10 84.01
FC-SA 86.24 87.12 86.85

这个结果说明:即使后面的分类器不变,FC 是怎么构造的也会显著影响性能。FC-SA 的优势不是单纯来自 attention,而是来自“预训练时空表示 + attention 构图”的组合。


消融实验:哪个模块最重要

论文设计了三个变体:

DBSTP-A:去掉双分支时空 Transformer 预训练,直接用 raw rsfMRI
DBSTP-B:把 FC-SA 换成传统 Pearson correlation
DBSTP-C:把 MG-GNN 换成普通全连接融合
模型 ACC F1 AUC
DBSTP-A 78.43 78.13 78.90
DBSTP-B 79.68 79.38 80.21
DBSTP-C 82.45 82.39 83.02
DBSTP 86.24 87.12 86.85

这里最值得注意的是:去掉预训练和替换 FC-SA 的下降最大。也就是说,这篇论文最核心的贡献不是最后的图分类器,而是前面两个步骤:

先学习时空表示;
再从这个表示里学习功能连接。

MG-GNN 也有贡献,但相对而言,它更像是把已有高质量 FC 和多粒度特征组织起来的下游分类模块。


FC 可视化:FC-SA 更稀疏,也更个体化

作者比较了 FC-SA 和 Pearson correlation 生成的功能连接矩阵。

FC-SA 与 Pearson FC 的矩阵对比,图源:论文原图裁剪

图中:

(a) FC-SA 的 ASD 样本
(b) FC-SA 的正常对照样本
(c) Pearson 的 ASD 样本
(d) Pearson 的正常对照样本

可以看到,Pearson FC 更均匀,很多区域之间都有中等强度相关;FC-SA 更稀疏,强连接集中在少数子网络中。

作者的解释是:Pearson 通过全程平均,把很多短时强耦合摊薄了;FC-SA 则更容易突出短暂但有诊断价值的连接模式。

论文还用三个指标比较 FC 的可靠性和个体区分性:

FC-SA 和 Pearson FC 的可靠性指标对比,图源:论文原图裁剪

根据讨论部分的总结,FC-SA 相比 Pearson:

ICC:0.43 -> 0.52
Differential identifiability:0.18 -> 0.30
Fingerprint hit rate:34% -> 57%

这说明 FC-SA 生成的脑网络不仅更稀疏,也更稳定、更能区分个体。


统计分析:模型确实在看瞬时耦合

作者进一步问了一个关键问题:

DBSTP 的 attention 是否真的对应动态功能连接变化,而不是只是另一个静态相关矩阵?

他们用滑动窗口动态 FC 作为参照,检验时空 attention 和动态 FC 波动之间的对齐程度。结果是:

grand mean Fisher z = 0.31
p < 0.001
FDR 后 4384 / 6670 条边仍显著
其中 71.4% 位于默认模式网络和额顶网络内部或二者之间

相反,如果把 attention 也做时间平均,对齐关系就消失了:

z = 0.04
p = 0.48

这个结果支持了论文最核心的论点:DBSTP 不是只学到静态相关,而是在利用 moment-to-moment 的瞬时耦合信息。

FDR 校正后显著连接的弦图,图源:论文原图裁剪


Biomarker:模型关注哪些脑区

最后,作者基于正确分类的 ASD 样本做可解释性分析,统计 ROI 和 FC 的贡献。

DBSTP 识别出的 ASD 相关脑连接模式,图源:论文原图裁剪

Top 10 ROI 包括:

ROI 缩写
Precuneus_R PCUN.R
Cingulum_Ant_R ACG.R
Lingual_L LING.L
Temporal_Inf_L ITG.L
Frontal_Sup_Medial_R SFGmed.R
Hippocampus_R HIP.R
Cerebelum_9_L CRBL9.L
Temporal_Pole_Mid_R TPOmid.R
Frontal_Mid_Orb_L ORBsupmed.L
Frontal_Inf_Oper_R IFGoperc.R

这些区域主要落在几个和 ASD 研究高度相关的系统里:

  • 默认模式网络:例如 precuneus。
  • 额顶控制系统:例如 anterior cingulate、medial frontal 区域。
  • 颞叶感知和语义处理网络:例如 inferior temporal gyrus、temporal pole。
  • 边缘系统和小脑相关区域:例如 hippocampus、cerebellar lobule IX。

这让模型的可解释性更可信:它不是只找到一组纯数据驱动的统计模式,而是和已有 ASD 神经影像研究中的关键脑区有一定一致性。


这篇论文真正值得记住的地方

这篇论文最重要的点,不是“又用了 Transformer 和 GNN”,而是它重新组织了 rsfMRI 分类的前处理逻辑。

传统流程通常是:

先用固定统计方法构造 FC
再让模型基于 FC 分类

DBSTP 的流程是:

先用模型学习 4D rsfMRI 的时空表示
再从表示里学习 FC
最后用图网络分类

这实际上把 FC 从一个固定输入,变成了一个可学习的中间表示。对于 ASD 这种高度异质、动态脑网络异常明显的任务,这个思路是合理的。

如果要压缩成一句话:

DBSTP 的贡献,是用时空预训练和 attention-based FC,把 ASD 识别从“静态相关矩阵分类”推进到“瞬时时空耦合建模”。


局限与可以继续追的问题

论文也有几个值得注意的限制。

第一,ROI 划分固定使用 AAL atlas。不同 atlas 可能会改变 FC 结构和 biomarker 解释,后续需要比较 CC200HO 或多 atlas 融合。

第二,模型只使用 rsfMRI。ASD 的脑网络异常也可能体现在结构连接或形态连接上,未来可以融合 DTI、结构 MRI 或形态连接。

第三,当前更偏 intra-subject 建模,也就是每个被试内部的脑网络。ASD 异质性很强,如果引入 population graph、症状量表或亚型聚类,可能更适合做个体化诊断。

第四,论文声称 FC-SA 更可解释,但 attention 权重是否能完全等同于神经生理意义上的连接强度,仍然需要谨慎。这里更稳妥的说法是:FC-SA 给出了一个和动态 FC、已知脑区系统具有统计一致性的模型解释。


我的总结

DBSTP 是一篇结构完整、动机清楚的 rsfMRI ASD 识别论文。它的强点在于:没有把重点只放在最后的分类器,而是从功能连接构建这一步重新设计。

我认为这篇文章最有价值的启发是:

在脑疾病分类里,FC 不一定只能是 Pearson 相关矩阵;
它也可以是一个由时空表征学习驱动的、任务相关的可学习脑网络。

这对后续做 fMRI、脑网络 GNN 或医学影像预训练都有参考价值。尤其是当疾病信号可能表现为短时动态耦合,而不是稳定静态差异时,直接从原始 4D 数据中学习表示,可能比先手工压成静态矩阵更合适。

注:本文图片均来自论文原图裁剪,仅用于论文阅读笔记与方法解析。若用于公开发布,请按原论文版权要求确认配图使用权限。


See also