跳转至

Lifelong Learning in VLMs: Enhanced EWC Cross-Modal — arXiv:2605.12789

论文概览

本文针对大型视觉-语言模型(LVLM)在多模态场景下的灾难性遗忘问题,提出了一种结合增强版弹性权重巩固(EWC)与参数高效微调技术的持续学习框架。

摘要(机器翻译)

CLIP、Flamingo、BLIP 等大型视觉-语言模型通过实现跨文本和视觉模态的理解彻底革新了 AI。这些模型在图像描述、视觉问答和跨模态检索等任务上表现出色。然而,它们在学习新任务时面临灾难性遗忘的挑战,在多模态设置中保持跨模态对齐使学习过程更加复杂。本文提出了一个针对 LVLM 的综合持续学习框架,将增强版弹性权重巩固(EWC)与参数高效微调技术相结合。框架集成了多模态 Fisher 信息矩阵计算、跨模态一致性保持以及考虑视觉和文本编码器之间依赖关系的自适应正则化。广泛评估测试表明,该框架相比朴素序贯训练方法实现了 78% 的遗忘率降低。该框架还在序贯学习过程中保持模态间的对齐,仅增加 15% 的计算成本。本文推进了多模态 AI 系统终身学习的研究进展,可直接应用于自动驾驶、智能机器人助手以及需要在动态真实世界环境中持续学习的自适应机器人系统。

核心贡献

  1. 多模态 Fisher 信息矩阵:提出针对 LVLM 视觉和文本编码器的 Fisher 信息矩阵计算方法
  2. 跨模态一致性保持:确保在学习新任务时,视觉-文本对齐关系不被破坏
  3. 自适应正则化:考虑视觉和文本编码器之间的依赖关系,动态调整正则化强度
  4. 参数高效微调集成:将 EWC 与 LoRA/Adapters 等参数高效方法结合,控制计算开销

为什么重要

多模态 AI 系统(VLM, LVLM)正在成为端侧部署的重要形态,但持续学习研究大多聚焦于纯语言模型。跨模态对齐的保持比单模态更具挑战性——破坏视觉-文本关联的影响比破坏单一模态表征更难恢复。本文填补了这一空白,对具身 AI、AR/VR 助手等场景意义重大。

与移动端/端侧相关性

  • LVLM 在端侧部署的持续学习能力直接影响移动端 AI 助手的可用性
  • 15% 的额外计算成本对于现代端侧芯片(高通 NPU、苹果 Neural Engine)是可接受的
  • 自适应正则化避免了过度保护导致的新任务学习受阻

方法详解

问题分析

LVLM 的灾难性遗忘在多模态场景下更严重,原因有三: 1. 视觉和文本编码器分别学习不同任务时,跨模态对齐可能被独立破坏 2. 新任务数据分布可能与旧任务的视觉-文本配对差异很大 3. 参数高效微调方法的稀疏更新模式使 Fisher 信息估计更困难

框架设计

多模态 Fisher 信息矩阵: - 分别计算视觉编码器和文本编码器的 Fisher 信息 - 考虑跨模态注意力层的贡献 - 使用对角近似加速计算

跨模态一致性保持: - 保持视觉-文本相似度矩阵不变 - 约束跨模态注意力权重不被大幅修改 - 引入对比学习损失维护新旧任务的跨模态对齐

自适应正则化: - 根据任务相似度动态调整 EWC 正则化强度 - 高相似度任务加强保护,低相似度任务降低约束

评估结果

指标 朴素序贯训练 EWC 本框架
遗忘率降低 基准 -45% -78%
模态对齐保持 62% 74% 91%
计算成本增加 0% 22% 15%

参考文献

  • 原论文: https://arxiv.org/abs/2605.12789