VAST 精读:CLIP 持续学习里,视觉分支为什么忘得比文本快
论文信息
论文题目:Mitigate Modality-Asymmetric Forgetting via Stabilizing Visual Representations in CLIP-Based Class-Incremental Learning
作者:Yuanhong Zhang、Yanan Chen(共同一作)、Xin Zhang、Zhaoyang Wang、Weizhan Zhang(通讯)、Muyao Yuan、Hongjin Niu、Lan Ma、Yuan Gao、Joey Tianyi Zhou;单位为西安交通大学、新加坡 A*STAR 与中国电信。
版本:双盲投稿版 PDF(20 页,正文 15 页 + 参考文献 5 页),暂无公开 arXiv 编号与代码仓库,本篇基于本地 PDF 精读;若正式发表后补充链接,结论以正式版为准。
任务设定:基于 CLIP 的无回放类增量学习(CIL)——骨干冻结,LoRA 微调,新类别按任务序列到达,推理时不提供任务标识符,不保留任何旧样本。
先看结论
VAST 解决的是一个此前被整个方向忽视的现象:模态不对称遗忘。同一个模型、同一批 LoRA 更新,两个模态的命运完全不同——文本分支基本不动,视觉分支高层被持续改写,旧类特征簇在新任务训练后发生位移与混杂。
方法只有一个核心动作:给视觉分支造一个文本分支天然拥有的"锚点"。分两步:
| 机制 | 模块 | 做什么 |
|---|---|---|
| 锚点构建 | VRRM(视觉表征增强模块) | 从任务无关的中间层提取稳定空间拓扑,与文本对齐的高层语义融合进 CLS token |
| 锚点迁移 | 矩阵联合熵结构蒸馏 | 跨任务对齐 Gram 矩阵结构,而非逐点匹配特征 |
关键数字(CLIP ViT-B/16,五次随机种子平均):
| 基准 · 设定 | VAST(Avg/Last) | 最强基线 |
|---|---|---|
| CIFAR100 · B10_Inc10 | 87.40 / 80.40 | DMNSP 87.23 |
| ImageNet-R · B20_Inc20 | 87.61 / 82.83 | 见原文 Table 1 |
| ImageNet-1K · B200_Inc200 | 82.43 / 74.87 | 见原文 Table 1 |
两个次级结论同样值得注意:零样本迁移上 VAST(74.28)最接近原始 CLIP(75.35),而回放方法 PROOF 掉到 52.49;结构可分性 FDR 在学习新任务后从 2.48 升至 2.97,而 LoRA 基线从 2.19 降到 2.08——锚点不是"少忘",而是让特征几何在持续学习中变好了。
背景:CLIP 持续学习的方法版图
传统 CIL 在单流视觉网络上从头训练,受制于可扩展性与数据效率。CLIP 出现后,主流做法转为冻结骨干 + 参数高效微调(PEFT):
- 提示类(L2P、Dual-Prompt、CODA-Prompt、ENGINE):学习任务感知的文本或视觉提示;
- 适配器类(MoE4CL、LGVLM):在 Transformer 层内插入小型可训练模块,MoE 路由或任务专属 LoRA;
- 跨模态一致性类(PROOF、CLAP4CLIP、MG-CLIP、DMNSP):调节梯度、缩小模态差距或增强跨模态交互。
这条版图上的所有方法都默认一个前提:视觉与文本两条分支同质,用同一套正则、同一套蒸馏对称地对待。而本文的实证分析表明这个前提不成立——两分支的遗忘机制根本不同。另外,方法所借鉴的自相关注意力(CLIPSurgery、GEM、SCLIP、ClearCLIP)此前只服务于静态任务的密集预测,从未被用于持续学习中构建稳定结构。
核心洞察:遗忘的模态不对称性
证据一:Fisher 信息只在一侧爆炸
Fisher 信息(FI)度量参数对任务更新的敏感度。在 CIFAR100 上用 LoRA 顺序微调 CLIP:

- 文本编码器:所有层 FI 保持低位——预训练语言表征提供概念级参考结构,天然充当"语义锚点";
- 视觉编码器:靠后的层 FI 急剧上升——高层承受全部适应压力,对当前类别过拟合。
图中的余弦相似度曲线还显示一个反直觉现象:视觉-文本对齐度随训练上升,但视觉分支的结构稳定性同时在下降——对齐变好与遗忘加剧同时发生,说明对齐本身不等于稳定。
证据二:旧类特征簇漂移

学习 Task 1 后再评估 Task 0:类簇分离、位移、边界混杂。这是视觉高层过适应的直接表征证据。
证据三:知识蒸馏救不了结构漂移
常规 KD(LwF 式)让新模型逐点模仿旧模型特征。但旧特征本身已经漂移、结构不稳定——蒸馏等于让新模型去拟合一个错误且不稳定的靶子,传递甚至放大不稳定性。这解释了为什么现有蒸馏类方法(ZSCL 等)无法根治 CLIP 的视觉遗忘。
三组证据合起来指向一个结论:文本分支有锚(语言概念),视觉分支没有。补上这个锚,就是 VAST 的全部设计。
方法:造锚(VRRM)+ 迁锚(结构蒸馏)

机制一:VRRM 构建视觉锚点
分三个阶段:
① 结构保持注意力。 标准 query-key 注意力的 query 在持续学习中极易漂移。VAST 改用第 7 层的 key-key 自相关构建与 query 无关的结构基础:
再叠加二阶关系 传播相邻 patch 的亲和性,最终:
选择中间层(第 5–8 层)不是任意的:这些层保留任务无关的空间关系,是视觉编码器里最"不动"的部分——把它当结构地基。
② 文本引导的值精化。 空间拓扑稳定了,内容还要对齐语义。高层 – 按其与文本嵌入 的余弦相似度做 softmax 加权:
语义相关的层获得更大权重,锚点既稳又对齐目标概念。
③ 注入 CLS。 稠密特征 经轻量注意力残差融回全局 CLS token:
。产出 ——中层空间拓扑 + 高层语义的融合体,即视觉结构锚点。
机制二:矩阵联合熵结构蒸馏
有了锚点,还要让它在任务间被"继承"。KL/MSE 是逐点匹配,无法度量分布的结构性变化。VAST 采用基于矩阵的 阶 Rényi 联合熵(),对任务 与 的特征 Gram 矩阵 计算结构发散:
联合熵越低,结构对齐越强。蒸馏损失由两项之差构成:
第二项把旧特征矩阵用随机置换 打乱后再算一次联合熵——减去"随机水平"的相关性,蒸馏只锁定真实的高层语义结构,不追噪声。这与 DiME 的互信息估计思想同源。总目标:
视觉、文本两侧对称约束,但视觉侧的 已经被 VRRM 稳定化——先造锚,再传锚,两个机制是乘法关系而非加法关系。
实验:结果、消融与漂移的定量闭环
主结果:非回放方法反超回放方法

九个增量设定全部第一。ImageNet-R 上比回放方法 RAPF/PROOF 平均高 1.96–4.48 个点——这在"回放方法理应更强"的常识之外。大规模 ImageNet-1K(1000 类)上增益收窄但保持领先。
零样本:稳定结构优于记住数据

回放方法 PROOF 因下游过拟合掉到 52.49,VAST 保持 74.28。这组数字支撑了论文的核心论断:稳定结构比记住数据更接近"保留 CLIP"。
消融:两机制的乘法效应

LoRA 基线 84.81 → +VRRM 86.90 → +蒸馏 86.96 → 双开 87.40(CIFAR100 B10_Inc10,Avg)。更有说服力的是交叉验证:


- 把 VRRM 插进 KL/MSE/CKC 蒸馏框架,全都涨——说明结构不稳定时,任何蒸馏都被拖累;
- 结构蒸馏单独用也涨,但配合 VRRM 达到最优——两机制互补。
- 注意力变体上,二阶自相关(Ours)优于纯 KK 相关与标准 QK;聚合策略上,文本感知加权优于均匀平均与仅末层。
漂移的定量闭环



FDR、t-SNE、注意力图三组证据与开头的 Fig.2/3 首尾呼应:问题发现(FI 不对称)→ 机理归因(缺锚点)→ 干预验证(FDR 反升)。整篇论文的叙事是闭环的。
参数敏感性

多数中间层表现相近,第 7 层略优; 过强或过弱都退化, 同理。方法对超参不敏感,鲁棒性良好。
局限与思考
- 锚点是概念性定义。 "视觉锚点"被定义为"跨任务保持几何结构的稳定表征",但论文用 FDR 与 t-SNE 间接验证,未直接度量锚点自身的稳定性(例如锚点漂移曲线)。审稿人若要求正面证据,现文只答了一半。
- CIFAR100 上的优势很薄。 对最强基线 DMNSP 的 Avg 优势仅 +0.17(87.40 vs 87.23);主要增益集中在 ImageNet-R 等域偏移场景。这与"稳定结构"的卖点一致——域偏移越大,锚点越有价值——但也意味着在分布稳定的基准上方法接近饱和。
- 计算开销未报告。 VAST 额外调用第 7 层 K、第 9–11 层 V 并做二阶矩阵乘( 与 ),推理时也保留 VRRM 路径。论文未给出训练时间、显存与推理延迟对比,实际部署成本未知。
- 源头借鉴的关系值得注意。 自相关注意力全部来自训练无关 CLIP 密集预测方法(CLIPSurgery/GEM/SCLIP 一脉),矩阵熵蒸馏来自 DiME。VAST 的原创性在于"把它们搬到 CIL 里当锚用"这个组合与问题发现本身,而非任何单一组件——作为方法论文这成立,但跟踪该脉络的读者应知道技术源头。
- 无公开代码与链接。 双盲投稿阶段无 arXiv 与 GitHub,数字暂无法独立复现;正式发表后需复核(尤其 Table 1 中 ImageNet-1K 的窄幅优势与 Fig.5/6 的消融绝对值)。
总结
VAST 的价值排序:问题发现 > 机理归因 > 方法设计。"模态不对称遗忘"把 CLIP 持续学习的研究对象从"任务间干扰"细化到"模态间失衡",这个视角本身就有后续空间——锚点能否显式可学、能否迁移到音频/多模态大模型、Fisher 信息能否作为训练时的自适应信号,都是顺着这条线能展开的问题。方法上"先稳定结构、再做蒸馏"的两步论,对其他蒸馏框架同样成立,这一点由交叉消融支撑得比较扎实。
See also
- StyCona 精读:SVD 把域偏移拆成风格与内容,数据增强各打各的 2026-09-04
- PHFNet 精读:全阶段并行 CNN–Transformer,线性注意力里把弱红外目标补回来 2026-09-03
- GLCNet 精读:小波打散相干斑,全局-局部协作做真实 SAR 去斑 2026-09-02
- DCRM-ViT 精读:冻结骨干,按样本现调参数的多域视觉 Transformer 2026-08-28
- TGC-Net 精读:把 CLIP 轻量地搬进文本引导医学图像分割 2026-08-26