MANGO: Meta-Adaptive Network Gradient for Online CL — arXiv:2605.19080
摘要¶
在在线持续学习(OCL)中,神经网络从非平稳数据流中顺序学习,仅能访问有限的记忆回放缓冲区。这与离线持续学习形成鲜明对比——后者可对大数据集进行多轮训练。OCL 的核心挑战在于克服灾难性遗忘(保持旧任务的稳定性)的同时高效学习新任务(可塑性)。MANGO(Meta-Adaptive Network Gradient Optimization)通过梯度门控和元学习正则化来平衡稳定性与可塑性:梯度门控根据敏感度缩放参数更新,防止破坏性更新;元学习正则化自适应调整稳定性系数,将回放样本同时作为训练信号和遗忘评估器。在 CLEAR-10 领域增量学习和 CIFAR-100、Tiny-ImageNet 类别增量学习上达到最优性能,并在 CLEAR-10 上实现正向反向迁移,有效克服遗忘。
核心贡献¶
- 梯度门控机制:根据参数敏感度动态缩放更新幅度,防止对已学知识的破坏性覆盖
- 元学习正则化:将回放缓冲区同时作为训练信号和遗忘评估器,自适应调整各参数的稳定性系数
- 稳定性-可塑性平衡:通过梯度门控实现参数级控制,而非粗粒度的整体正则化
- SOTA 性能:在多种回放大小下均超越强基线,尤其在低回放场景优势明显
为什么重要¶
在线持续学习是端侧智能的核心挑战——设备无法长期存储所有历史数据,必须在单遍 streaming 场景下同时解决学习和遗忘问题。MANGO 的梯度门控思路对理解如何在资源受限条件下管理记忆稳定性有重要参考价值,其将回放样本作为「遗忘指示器」的思路值得在记忆压缩与选择性遗忘研究中借鉴。
与移动端/端侧的相关性¶
- 在线单遍学习模式天然适合移动/端侧部署,无需保存完整历史数据集
- 梯度敏感度度量可指导端侧模型在有限更新预算下的记忆保持策略
- 元学习正则化计算可离线完成,在线推理开销小,适合边缘设备
方法细节¶
MANGO 将 OCL 建模为双目标优化:学习新任务的效率(可塑性)和保持旧任务性能(稳定性)。具体而言:
- 梯度门控:对每个参数计算其对旧任务损失的敏感度,高敏感度参数获得较小更新步长,防止被新任务覆盖
- 元学习正则化:在元学习阶段同时考虑当前任务损失和回放样本上的遗忘信号,动态调整各参数的正则化强度
- 回放的双重角色:回放样本既参与当前任务学习(提供训练信号),又用于评估参数更新对旧知识的破坏程度(遗忘指示器)
实验在三种标准 OCL 基准上验证:CLEAR-10(领域增量)、CIFAR-100(类别增量)和 Tiny-ImageNet(类别增量)。MANGO 在所有回放大小设置下均达到最高准确率,且在 CLEAR-10 上首次实现正向反向迁移(学新忘旧的现象被克服)。
参考文献¶
见原文:https://arxiv.org/abs/2605.19080