VAST 精读:CLIP 持续学习里,视觉分支为什么忘得比文本快

Date 2026-09-11 · Category tech · Status finished · Confidence likely
论文解读, 持续学习, CLIP

论文信息

论文题目:Mitigate Modality-Asymmetric Forgetting via Stabilizing Visual Representations in CLIP-Based Class-Incremental Learning

作者:Yuanhong Zhang、Yanan Chen(共同一作)、Xin Zhang、Zhaoyang Wang、Weizhan Zhang(通讯)、Muyao Yuan、Hongjin Niu、Lan Ma、Yuan Gao、Joey Tianyi Zhou;单位为西安交通大学、新加坡 A*STAR 与中国电信。

版本:双盲投稿版 PDF(20 页,正文 15 页 + 参考文献 5 页),暂无公开 arXiv 编号与代码仓库,本篇基于本地 PDF 精读;若正式发表后补充链接,结论以正式版为准。

任务设定:基于 CLIP 的无回放类增量学习(CIL)——骨干冻结,LoRA 微调,新类别按任务序列到达,推理时不提供任务标识符,不保留任何旧样本。

先看结论

VAST 解决的是一个此前被整个方向忽视的现象:模态不对称遗忘。同一个模型、同一批 LoRA 更新,两个模态的命运完全不同——文本分支基本不动,视觉分支高层被持续改写,旧类特征簇在新任务训练后发生位移与混杂。

方法只有一个核心动作:给视觉分支造一个文本分支天然拥有的"锚点"。分两步:

机制 模块 做什么
锚点构建 VRRM(视觉表征增强模块) 从任务无关的中间层提取稳定空间拓扑,与文本对齐的高层语义融合进 CLS token
锚点迁移 矩阵联合熵结构蒸馏 跨任务对齐 Gram 矩阵结构,而非逐点匹配特征

关键数字(CLIP ViT-B/16,五次随机种子平均):

基准 · 设定 VAST(Avg/Last) 最强基线
CIFAR100 · B10_Inc10 87.40 / 80.40 DMNSP 87.23
ImageNet-R · B20_Inc20 87.61 / 82.83 见原文 Table 1
ImageNet-1K · B200_Inc200 82.43 / 74.87 见原文 Table 1

两个次级结论同样值得注意:零样本迁移上 VAST(74.28)最接近原始 CLIP(75.35),而回放方法 PROOF 掉到 52.49;结构可分性 FDR 在学习新任务后从 2.48 升至 2.97,而 LoRA 基线从 2.19 降到 2.08——锚点不是"少忘",而是让特征几何在持续学习中变好了

背景:CLIP 持续学习的方法版图

传统 CIL 在单流视觉网络上从头训练,受制于可扩展性与数据效率。CLIP 出现后,主流做法转为冻结骨干 + 参数高效微调(PEFT):

  • 提示类(L2P、Dual-Prompt、CODA-Prompt、ENGINE):学习任务感知的文本或视觉提示;
  • 适配器类(MoE4CL、LGVLM):在 Transformer 层内插入小型可训练模块,MoE 路由或任务专属 LoRA;
  • 跨模态一致性类(PROOF、CLAP4CLIP、MG-CLIP、DMNSP):调节梯度、缩小模态差距或增强跨模态交互。

这条版图上的所有方法都默认一个前提:视觉与文本两条分支同质,用同一套正则、同一套蒸馏对称地对待。而本文的实证分析表明这个前提不成立——两分支的遗忘机制根本不同。另外,方法所借鉴的自相关注意力(CLIPSurgery、GEM、SCLIP、ClearCLIP)此前只服务于静态任务的密集预测,从未被用于持续学习中构建稳定结构。

核心洞察:遗忘的模态不对称性

证据一:Fisher 信息只在一侧爆炸

Fisher 信息(FI)度量参数对任务更新的敏感度。在 CIFAR100 上用 LoRA 顺序微调 CLIP:

图 1:CLIP 视觉与文本编码器的层级 Fisher 信息。视觉分支(左)高层 FI 急剧上升,文本分支(右)全程平稳

  • 文本编码器:所有层 FI 保持低位——预训练语言表征提供概念级参考结构,天然充当"语义锚点";
  • 视觉编码器:靠后的层 FI 急剧上升——高层承受全部适应压力,对当前类别过拟合。

图中的余弦相似度曲线还显示一个反直觉现象:视觉-文本对齐度随训练上升,但视觉分支的结构稳定性同时在下降——对齐变好与遗忘加剧同时发生,说明对齐本身不等于稳定。

证据二:旧类特征簇漂移

图 2:Task 0 类别 CLS 特征 t-SNE。左:LoRA 微调 Task 0 后;右:继续微调 Task 1 后,旧类簇位移并混杂

学习 Task 1 后再评估 Task 0:类簇分离、位移、边界混杂。这是视觉高层过适应的直接表征证据。

证据三:知识蒸馏救不了结构漂移

常规 KD(LwF 式)让新模型逐点模仿旧模型特征。但旧特征本身已经漂移、结构不稳定——蒸馏等于让新模型去拟合一个错误且不稳定的靶子,传递甚至放大不稳定性。这解释了为什么现有蒸馏类方法(ZSCL 等)无法根治 CLIP 的视觉遗忘。

三组证据合起来指向一个结论:文本分支有锚(语言概念),视觉分支没有。补上这个锚,就是 VAST 的全部设计。

方法:造锚(VRRM)+ 迁锚(结构蒸馏)

图 3:VAST 总体框架。VRRM 将局部感知与文本感知特征注入视觉 CLS token;分布感知蒸馏通过矩阵熵保持跨任务结构

机制一:VRRM 构建视觉锚点

分三个阶段:

① 结构保持注意力。 标准 query-key 注意力的 query 在持续学习中极易漂移。VAST 改用第 7 层的 key-key 自相关构建与 query 无关的结构基础:

再叠加二阶关系 传播相邻 patch 的亲和性,最终:

选择中间层(第 5–8 层)不是任意的:这些层保留任务无关的空间关系,是视觉编码器里最"不动"的部分——把它当结构地基。

② 文本引导的值精化。 空间拓扑稳定了,内容还要对齐语义。高层 按其与文本嵌入 的余弦相似度做 softmax 加权:

语义相关的层获得更大权重,锚点既稳又对齐目标概念。

③ 注入 CLS。 稠密特征 经轻量注意力残差融回全局 CLS token:

。产出 ——中层空间拓扑 + 高层语义的融合体,即视觉结构锚点

机制二:矩阵联合熵结构蒸馏

有了锚点,还要让它在任务间被"继承"。KL/MSE 是逐点匹配,无法度量分布的结构性变化。VAST 采用基于矩阵的 阶 Rényi 联合熵(),对任务 的特征 Gram 矩阵 计算结构发散:

联合熵越低,结构对齐越强。蒸馏损失由两项之差构成:

第二项把旧特征矩阵用随机置换 打乱后再算一次联合熵——减去"随机水平"的相关性,蒸馏只锁定真实的高层语义结构,不追噪声。这与 DiME 的互信息估计思想同源。总目标:

视觉、文本两侧对称约束,但视觉侧的 已经被 VRRM 稳定化——先造锚,再传锚,两个机制是乘法关系而非加法关系。

实验:结果、消融与漂移的定量闭环

主结果:非回放方法反超回放方法

表 1:五个基准、九个增量设定上的 Avg/Last 全面对比,VAST 全部最优(加粗)

九个增量设定全部第一。ImageNet-R 上比回放方法 RAPF/PROOF 平均高 1.96–4.48 个点——这在"回放方法理应更强"的常识之外。大规模 ImageNet-1K(1000 类)上增益收窄但保持领先。

零样本:稳定结构优于记住数据

表 2:CIFAR100 训练后在未见数据集上的零样本性能。VAST 74.28 最接近原始 CLIP 75.35

回放方法 PROOF 因下游过拟合掉到 52.49,VAST 保持 74.28。这组数字支撑了论文的核心论断:稳定结构比记住数据更接近"保留 CLIP"

消融:两机制的乘法效应

表 3:VRRM 与 L_distill 组件消融,CIFAR100 与 ImageNet-R 双设定

LoRA 基线 84.81 → +VRRM 86.90 → +蒸馏 86.96 → 双开 87.40(CIFAR100 B10_Inc10,Avg)。更有说服力的是交叉验证:

图 4:VRRM 组件消融。左:注意力变体(QK / KK / 二阶);右:文本感知聚合策略

图 5:蒸馏策略对比。本文结构蒸馏对比 LwF/Mod-X 的 KL/MSE 与 CKC,在 B10_Inc10 与 B50_Inc10 两设定下

  • 把 VRRM 插进 KL/MSE/CKC 蒸馏框架,全都涨——说明结构不稳定时,任何蒸馏都被拖累
  • 结构蒸馏单独用也涨,但配合 VRRM 达到最优——两机制互补。
  • 注意力变体上,二阶自相关(Ours)优于纯 KK 相关与标准 QK;聚合策略上,文本感知加权优于均匀平均与仅末层。

漂移的定量闭环

表 4:FDR(类间/类内方差比)定量分析。VAST 从 2.48 升至 2.97,LoRA 基线从 2.19 降至 2.08

图 6:旧类 CLS 特征 t-SNE。左:LoRA 基线簇纠缠;右:+VAST 紧凑且分离良好

图 7:CLS-to-patch 注意力图。VRRM 的激活与物体轮廓对齐,基线与 DMNSP 的激活分散且常落在背景

FDR、t-SNE、注意力图三组证据与开头的 Fig.2/3 首尾呼应:问题发现(FI 不对称)→ 机理归因(缺锚点)→ 干预验证(FDR 反升)。整篇论文的叙事是闭环的。

参数敏感性

图 8:融合系数 β、蒸馏权重 λ 与自相似层 M 的敏感性。λ=0.5、β=0.1、M=7 处最优

多数中间层表现相近,第 7 层略优; 过强或过弱都退化, 同理。方法对超参不敏感,鲁棒性良好。

局限与思考

  • 锚点是概念性定义。 "视觉锚点"被定义为"跨任务保持几何结构的稳定表征",但论文用 FDR 与 t-SNE 间接验证,未直接度量锚点自身的稳定性(例如锚点漂移曲线)。审稿人若要求正面证据,现文只答了一半。
  • CIFAR100 上的优势很薄。 对最强基线 DMNSP 的 Avg 优势仅 +0.17(87.40 vs 87.23);主要增益集中在 ImageNet-R 等域偏移场景。这与"稳定结构"的卖点一致——域偏移越大,锚点越有价值——但也意味着在分布稳定的基准上方法接近饱和。
  • 计算开销未报告。 VAST 额外调用第 7 层 K、第 9–11 层 V 并做二阶矩阵乘(),推理时也保留 VRRM 路径。论文未给出训练时间、显存与推理延迟对比,实际部署成本未知。
  • 源头借鉴的关系值得注意。 自相关注意力全部来自训练无关 CLIP 密集预测方法(CLIPSurgery/GEM/SCLIP 一脉),矩阵熵蒸馏来自 DiME。VAST 的原创性在于"把它们搬到 CIL 里当锚用"这个组合与问题发现本身,而非任何单一组件——作为方法论文这成立,但跟踪该脉络的读者应知道技术源头。
  • 无公开代码与链接。 双盲投稿阶段无 arXiv 与 GitHub,数字暂无法独立复现;正式发表后需复核(尤其 Table 1 中 ImageNet-1K 的窄幅优势与 Fig.5/6 的消融绝对值)。

总结

VAST 的价值排序:问题发现 > 机理归因 > 方法设计。"模态不对称遗忘"把 CLIP 持续学习的研究对象从"任务间干扰"细化到"模态间失衡",这个视角本身就有后续空间——锚点能否显式可学、能否迁移到音频/多模态大模型、Fisher 信息能否作为训练时的自适应信号,都是顺着这条线能展开的问题。方法上"先稳定结构、再做蒸馏"的两步论,对其他蒸馏框架同样成立,这一点由交叉消融支撑得比较扎实。


See also