SDF:ASD 识别为什么要同时看静态和动态功能连接
论文信息
论文题目:Static-dynamic functional connectivity fusion via cross-attention for ASD identification
发表 venue:Biomedical Signal Processing and Control, 2026
这篇论文研究的是基于静息态功能磁共振 rs-fMRI 的 ASD 辅助识别。输入是 116 个脑区随时间变化的 BOLD 信号,输出是被试更可能属于 ASD 还是正常对照。
作者提出的模型叫 SDF,全称是 Static-Dynamic Fusion。先说结论:
这篇论文最重要的地方,不是又加了一个 attention,而是把
静态功能连接、动态功能连接和交互式融合这三件事接成了一条完整链路。

核心动机:只看静态,或者只看动态,都不够
在 rs-fMRI 脑网络分析里,最常见的两种视角是:
- 静态功能连接 sFC:把整段扫描时间放在一起,看脑区之间整体上是否同步。
- 动态功能连接 dFC:把时间切成多个小窗,看脑区关系如何随时间变化。
这两种视角各有优点,也各有明显短板。
1. 只看静态连接,会把时间变化平均掉
静态连接更像一张“长曝光照片”。
它能告诉你:
- 哪些脑区长期协同;
- 哪些网络关系整体偏强或偏弱;
- 脑网络的全局结构大致是什么样。
但它的问题也很直接:
- 短时间里的异常波动会被平均掉;
- 某些只在局部时间段出现的异常连接不容易留下痕迹;
- 动态重组过程会被压成一张静态图。
2. 只看动态连接,又容易忽略稳定结构
动态连接更像“分镜视频”。
它能看到:
- 某些脑区关系是不是会突然增强或减弱;
- 脑网络是不是在不同时间段有不同配置;
- 某些时变模式是否和疾病状态相关。
但动态方法也不完美:
- 更容易受噪声影响;
- 时间窗切分本身会引入不稳定性;
- 如果只看局部变化,反而不容易把握全局稳定结构。
所以这篇论文真正要回答的问题不是:
静态和动态谁更好?
而是:
能不能把稳定结构和时间变化都保留下来,并且让它们真正互动,而不是简单拼接?
一句话看懂 SDF
这篇论文的整体思路可以压缩成下面这条主线:
同一段 rs-fMRI 时间序列
-> 静态分支学习稳定脑连接
-> 动态分支学习时间演化模式
-> 用 cross-attention 让两种特征互动
-> 输出 ASD / NC 分类结果
如果再翻得更直白一点:
静态分支回答:整体脑网络长什么样
动态分支回答:脑网络是怎么变的
融合分支回答:哪些变化是在这个整体结构下最值得关注的
整体方法:三段式结构
SDF 的框架其实很规整,可以拆成三个模块:
- 静态分支 从整段时间序列里学习稳定脑连接表示。
- 动态分支 先切时间窗,再建模多个时间窗之间的演化关系。
- 融合分支 不是直接拼接,而是用 cross-attention 让静态信息去筛选动态信息。
这套设计最关键的一点在于:
前两条支路不是各做各的,真正的价值在第三步融合时才被放大。
模块一:静态分支在做什么
静态分支对应图里的上半条路径。
它的输入不是已经构好的 FC 矩阵,而是原始的 ROI 时间序列。作者先把每个脑区的时间信号送进一个 Transformer encoder,再从编码后的表示里构造静态连接。
这条分支的流程可以翻成人话:
整段 ROI 时间序列
-> 线性映射
-> 加入时间位置信息
-> 多头注意力建模整段时间依赖
-> 得到每个脑区的高层表示
-> 两两组合,生成静态连接矩阵
-> 压缩成静态特征 X_S
这和传统 Pearson FC 的差别很重要。
传统做法会直接问:
脑区 A 和脑区 B 在整段时间里平均是否同步?
而这里的做法更像:
先让模型学习整段时间序列里哪些时刻和模式更重要,
再根据这种更高层的表示去构造脑区之间的稳定关系。
所以这篇论文里的静态连接不是“直接算出来的”,而是“先学表示,再构出来的”。
模块二:动态分支在做什么
动态分支对应图里的下半条路径,也是图中最容易看乱的部分。
它不是把原始时间序列直接送进一个 TCN,而是先做了一次“分窗构图”。
具体流程是:
原始时间序列
-> 按时间切成 K 个不重叠窗口
-> 每个窗口单独构造一个功能连接矩阵
-> 每个矩阵取下三角并拉平成向量
-> 把 K 个向量按时间堆成序列
-> 整个序列一起送进 TCN
-> 再对不同时间窗输出做加权汇总
-> 得到动态特征 X_D
这里最关键的点有两个。
1. TCN 不是对每个窗口单独做
很多人第一次看图会以为:
每个窗口 flatten 后,各自过一个 TCN
其实不是。
正确理解应该是:
先把每个窗口变成一个向量,
再把这些向量按时间排成一个序列,
最后这个序列整体进入同一个 TCN。
也就是说,TCN 学的不是“某个窗口里有什么连接”,而是:
这些窗口对应的连接模式,前后是怎么演化的。
2. 动态分支最后还有一步“时间加权”
TCN 输出的是一串时间步特征,不是直接一个向量。
作者又加了一层线性打分和 softmax 权重,把不同时间窗的重要性学出来,再做加权求和。
这一步的含义也很明确:
不是每个时间窗都同样重要,
模型要自己决定哪些时间段更能帮助区分 ASD。
模块三:cross-attention 到底在做什么
这部分是整篇论文最核心的创新点,也是最值得单独讲清楚的地方。
很多融合方法会这么做:
- 直接把静态特征和动态特征拼接;
- 或者给两者一个固定权重后相加;
- 或者做一个比较浅的注意力加权。
这篇论文不这么做。它的思路是:
让静态特征当“筛选标准”,去读取动态特征里最有用的部分。
换句话说,融合模块不是在做:
静态 + 动态
而是在做:
静态如何去看动态
Q、K、V 在这篇论文里到底表示什么
如果不先讲清楚 Q / K / V,这篇论文右侧融合模块会很抽象。
attention 里这三个量可以先按检索系统来理解:
Q:你现在想找什么K:每个候选项的匹配标签V:候选项真正携带的内容
也可以翻成更直白的话:
Query:提问Key:索引Value:正文
attention 做的事就是:
拿 Query 去和 Key 比较
-> 看谁更匹配
-> 匹配得越高,对应的 Value 权重越大
-> 最后把这些 Value 按权重汇总
放到本文里,QKV 的来源是这样的
这篇论文的设计不是对称的。
Q来自静态特征X_SK来自静态特征X_SV来自动态特征X_D
这意味着什么?
它意味着:
- 匹配标准 由静态脑连接给出
- 真正被读取的内容 是动态脑连接信息
所以本文的 cross-attention,本质上是:
用稳定脑网络结构,去筛选时间变化中的关键模式。
为什么作者要这样设计
因为作者默认这样一个判断:
- 静态特征更稳,能提供全局结构参考;
- 动态特征更细,但也更容易夹杂噪声;
- 如果没有一个稳定框架去约束,动态信息很容易显得“丰富但不稳”。
所以融合模块的思路不是:
让静态和动态平等聊天
而是:
先让静态特征定义关注方向,
再从动态特征里读出真正有价值的变化信息。
如果用一句最短的话记忆这部分:
Q:静态分支现在想关注什么K:静态分支用什么标准去匹配V:动态分支真正提供什么时变信息
把图和公式一起翻成人话
这篇论文的公式不算多,但如果直接看原文,容易在符号上卡住。其实按图来对应就很清楚。
静态分支
Transformer block
-> 学整段时间依赖
-> 生成静态连接矩阵
-> 压成静态表示 X_S
动态分支
每个时间窗单独构图
-> 变成一串连接向量
-> TCN 学窗口之间的时间依赖
-> 对时间步加权
-> 压成动态表示 X_D
融合分支
X_S 生成 Q 和 K
X_D 生成 V
-> cross-attention
-> 多头拼接
-> pooling 和分类
如果只记一句:
公式不是在描述一个复杂黑箱,而是在把“先学稳定结构,再学时间变化,最后让稳定结构引导时间变化”这件事逐步写出来。
实验结果:SDF 真正证明了什么
论文在 ABIDE-I 的三个站点上做了 ASD / NC 二分类,总共用了 430 名受试者。主结果里,SDF 在三个站点的准确率都是第一。

| 站点 | BNT | DRAT | MCDGLN | SDF |
|---|---|---|---|---|
| NYU | 73.79 | 75.72 | 74.94 | 77.50 |
| UM | 74.24 | 84.67 | 82.57 | 86.25 |
| USM | 75.54 | 81.29 | 82.57 | 85.00 |
这说明至少有一件事是成立的:
静态信息和动态信息如果能被有效融合,确实比只看单一视角更容易分出 ASD。
不过这里也要保留一点分寸感。
SDF 的 ACC 很强,但并不是每个单项指标都全面碾压。例如在部分站点上,AUC 并不一定是最优。这意味着:
- 它在最终分类准确率上很有竞争力;
- 但不能简单说它在所有评价维度上都绝对领先。
消融实验:真正起作用的是哪一部分
论文的消融实验很关键,因为它回答了“到底是哪个模块带来了收益”。
作者设计了几个变体:
SDF-E:不建模时间动态SDF-T:去掉静态分支,只保留动态分支SDF-C:保留静态和动态,但直接拼接,不用 cross-attentionSDF-L:把 TCN 换成 LSTMSDF-S:静态分支去掉 transformer,只用更简单的双线性构图

这组实验给出的结论很清楚:
1. 动态分支不是可有可无
只看静态结构的 SDF-E 效果明显不如包含时间建模的版本。
这说明:ASD 相关异常不只是“脑网络平均长什么样”,还和“它怎么波动”有关。
2. 静态和动态都重要
只保留动态分支的 SDF-T 也不够好。
这说明:动态变化虽然重要,但没有稳定结构作为背景,模型并不容易把这些变化解释清楚。
3. 融合本身要讲方法,不是拼起来就行
SDF-C 比单独的静态或动态方法更好,说明“融合”本身是有效的。
但完整 SDF 又比 SDF-C 更强,说明:
真正的收益不只是“把两路特征都放进来”,而是“怎么让两路特征互动”。
4. TCN 和 transformer 都不是装饰
SDF-L 和 SDF-S 的性能下降说明:
- 动态分支里,TCN 对时间依赖建模确实有效;
- 静态分支里,先学表示再构图,比直接用简单构图更强。
这篇论文还有两点值得注意
1. 视觉网络和默认模式网络差异更明显
论文后面的网络级分析提到,VN 和 DMN 在区分 ASD 和正常对照时贡献更突出。这一点让模型不只是一个分类器,也给出了一些脑网络层面的解释线索。
2. 滑动窗口长度不是随便设的
作者比较了不同时间窗长度,发现 20 x TR 的设置最好。
这也再次说明:动态方法不是只要“切窗”就行,窗口长度会直接影响模型能看到的时间模式。
我会怎么理解这篇论文
如果把这篇论文放回到更大的 rs-fMRI 诊断脉络里,我会这样看它。
第一,它不是在发明一种全新的脑网络定义,而是在补一个长期存在的断层:
静态连接负责看稳定结构
动态连接负责看时间变化
真正的问题在于,两者过去常常没有被有效接起来
第二,它的 cross-attention 设计很有方向性。
这不是“双向对话式融合”,而是更像:
用稳定脑结构去约束动态信息读取
这个思路其实很合理,因为动态特征往往更丰富,但也更容易噪。
第三,这篇论文的实验是按站点分别评估的。
从我的理解看,它更像是在证明:
这种融合思路在不同站点内都成立。
但它还没有真正回答一个更难的问题:
如果在一个站点训练,在另一个站点测试,泛化会不会依然稳定?
这不是它做错了,而是它还没有走到那一步。
这篇论文的限制
作者自己也比较坦率地提到了几项限制:
- 只用了
AAL脑图谱; - 只用了
rs-fMRI推导出的功能连接; - 没有进一步结合结构连接信息。
如果往后继续做,我觉得比较自然的方向有三个:
- 比较不同 atlas 下静态和动态融合是否稳定;
- 把结构连接一起并入融合模块;
- 做更严格的跨站点泛化验证,而不只是站点内分类。
最后总结
SDF 这篇论文的价值,不在于单独某一个模块多新,而在于它把一个很关键的问题提得很准:
ASD 相关脑连接异常,既不是纯静态地图,也不是纯动态波动,而是稳定结构和时间变化共同作用的结果。
它的解决方案也很清晰:
静态分支给全局结构
动态分支给时间细节
cross-attention 决定哪些动态变化应该被保留下来
如果你想用一句最短的话记住这篇论文,我建议记成:
这不是一篇“把静态和动态拼起来”的论文,而是一篇“让静态结构去指导动态信息读取”的论文。
See also
- SCRWKV 论文总结:用结构校准 RWKV 做轻量裂缝分割 2026-07-27
- MambaLiteUNet:用 Mamba、双门控与净化跳连做轻量皮肤病变分割 2026-07-26
- UTANet:用任务自适应专家混合重构 U-Net 跳跃连接 2026-07-25
- DSC:让 U 型网络的跳跃连接在测试时适配医学图像 2026-07-23
- TG-HEM:用拓扑困难样本挖掘改进拥挤病理细胞检测 2026-07-22