
CLIP 类增量学习中被忽视的模态不对称遗忘:文本分支有概念级语义锚点所以稳,视觉分支没有所以高层 Fisher 信息激增、旧类 CLS 漂移。VAST 用跨层自相似注意力造视觉锚点(VRRM),再用矩阵联合熵做结构蒸馏,9 个增量设定全部 SOTA,且不需要任何回放数据。
Research · Engineering · AI
Curated for curious builders

CLIP 类增量学习中被忽视的模态不对称遗忘:文本分支有概念级语义锚点所以稳,视觉分支没有所以高层 Fisher 信息激增、旧类 CLS 漂移。VAST 用跨层自相似注意力造视觉锚点(VRRM),再用矩阵联合熵做结构蒸馏,9 个增量设定全部 SOTA,且不需要任何回放数据。

医学图像的域偏移被拆成风格偏移(奇异值)与内容偏移(秩一矩阵),StyCona 对两者分别做混合增强:风格增强管 ASD,内容增强管 DSC。心脏 MRI 双向迁移 73.39 / 81.59,眼底四目标域平均 DSC 73.16。

红外小目标在下采样中途就被背景吃掉。PHFNet 在 U-Net 每一级并行 CNN 与线性 Transformer,LCLA 用缩放+门控做局部补偿,BMRA 再校准融合特征。SIRST / NUDT-SIRST / IRSTD-1K 上 IoU 80.12 / 96.70 / 71.39。

真实 SAR 没有干净图,相干斑还空间相关。GLCNet 用小波-shuffle 把斑点打散,全局支路去相关、局部支路保细节,DGM 按区域把门。Sentinel-1 上 PSNR 18.96 / SSIM 0.6889,下游地物分类 mIoU 从 46.1 拉到 73.6。
Explore the collection

DCRM-ViT 把「医学适配不伤通用能力」做成硬约束:冻结 ViT 骨干,用域路由器按样本估计医学/自然概率,超网络 PSN 现场合成低秩调制参数,经 RMB 门控注入 Q/V 投影。仅 3.3M 可训练参数,微调 8 个数据集全胜、分割 6 个数据集全胜,推理零更新。

TGC-Net 把「CLIP 迁移到医学分割」拆成结构、语义、对齐三个鸿沟,用 SSE、DATE、VLCM 三个轻量模块逐一校准,冻结 CLIP 主干只训 10.3M 参数,在 7 个数据集、4 种模态上全面刷新 SOTA。

PIMamba 把扩散型物理先验同时写进 Mamba 的状态转移矩阵与损失函数:隐藏状态演化由扩散算子决定,光谱与空间两个分支分别施加反应–扩散方程残差损失,DPA 机制动态平衡两者权重。在四个公开高光谱数据集、每类 5 个标注样本的设定下,OA 较 MambaHSI 提升 3.21–5.66 个百分点,参数量为其 10%–13%。

MCD-CLIP 不重训整个 CLIP,而是用对齐的视觉 Prompt、共享/私有 Adapter 与图文分数融合,让正位和侧位胸片在少量可训练参数下共同完成疾病诊断。

MedCLIPSeg 在 CLIP 的深层加入概率化、双向的视觉-语言适配器,用少量标注、跨域测试和像素级不确定性回答医学分割中的三个问题:数据够不够、换域稳不稳、模型是否知道自己不确定。

SCRWKV 面向细长、弯曲、分叉裂缝的拓扑连续性与端侧效率矛盾:以 AMCM 补局部纹理、GBST 做双向结构变换、DSCD 动态控制 RWKV 衰减,并用 CSHF 做跨尺度融合。

MambaLiteUNet 在轻量 U-Net 的深层加入自适应多分支 Mamba 融合、局部-全局混合和交叉门控跳连,目标是在皮肤病变分割中同时改善边界质量、全局建模与部署成本。

UTANet 将 U-Net 固定的一对一跳跃连接改写为多尺度特征、稀疏专家和阶段专属路由器组成的任务自适应信息分配机制。

Dynamic Skip Connection 将动态多尺度卷积核与测试时训练放进 U 型网络的跳跃连接,尝试同时解决尺度失配、跨层特征融合僵化与医学影像分布变化。