iGSP: Implicit Gradient Subspace Projection for VLM CL — arXiv:2605.19301
摘要¶
视觉-语言模型(VLM)需要高效适应持续涌现的下游任务。参数高效微调(PEFT)虽然缓解了灾难性遗忘,但为每个任务分配独立模块会导致参数爆炸;现有的相似性驱动共享机制错误地将表层视觉相似性与底层对齐一致性混为一谈,导致在视觉相似但逻辑不同的任务间产生严重负迁移,同时无法利用跨视觉多样化任务的对齐复用。iGSP 提出将对齐共享建模为优化轨迹在共享低秩子空间中的几何重叠问题,通过隐式梯度子空间投影实现高效适应:第一阶段通过子空间识别和约束正则化将新任务梯度投影到历史子空间,第二阶段固定结构基座并移除正则化以快速拟合任务残差。在 MTIL 基准上,iGSP 以 42.7% 更少的可训练参数达到最优准确率,模型总参数量相比同类方法减少 86.9%。
核心贡献¶
- 几何对齐共享视角:首次将跨任务对齐共享建模为优化轨迹在低秩子空间中的重叠问题
- 隐式梯度投影:通过正则化隐式投影而非显式约束,实现梯度域的高效跨任务知识迁移
- MoE 路由器早期收敛:利用 MoE 路由器的早期收敛特性建立子空间基底
- 子空间剪枝:将路由概率作为梯度流指标,精确剪枝冗余维度
为什么重要¶
VLM 的持续适应是移动端多模态智能的核心问题——用户需要模型不断学习新任务但又不遗忘旧能力。iGSP 的子空间投影思路对理解「如何在参数层面实现记忆的解耦与复用」有重要价值,86.9% 的参数削减意味着更小的端侧存储开销。
与移动端/端侧的相关性¶
- 86.9% 参数削减直接降低端侧部署的存储和计算成本
- 子空间约束减少可训练参数同时保持性能,适合资源受限的移动设备
- 跨视觉多样化任务的对齐复用能力可用于移动端多场景统一模型
方法细节¶
iGSP 分为两个阶段:
子空间识别阶段(Subspace Identification): 1. 基底预扩展:为新任务引入候选专家模块 2. 隐式约束正则化:将新任务梯度投影到历史优化子空间,保持旧任务知识 3. 子空间剪枝:利用 MoE 路由器路由概率作为梯度流指标,剪除冗余维度
正交子空间微调阶段(Orthogonal Subspace Fine-Tuning): 固定结构基底,移除正则化,在正交子空间快速拟合任务特定残差损失。
在 MTIL(Multi-Task Incremental Learning)基准上的实验证明,iGSP 在视觉-语言任务上以显著更少的可训练参数达到了最优准确率。
参考文献¶
见原文:https://arxiv.org/abs/2605.19301