Prototypical Exemplar Condensation for CL — arXiv:2603.13804
摘要¶
基于回放的持续学习(CL)通过维护过去任务的样本子集来减轻灾难性遗忘。现有研究主要关注通过coreset选择策略优化记忆存储——这些方法虽然有效,但通常需要每个类存储超过20个样本才能保持令人满意的性能。该论文提出进一步压缩记忆占用:通过合成和存储原型样本(prototypical exemplars),这些样本通过特征提取器后能形成代表性原型。由于其代表性,这些样本使模型能够使用很少的样本保留先验知识,同时保护隐私。此外,论文引入基于扰动的增强机制,在训练过程中生成先前数据的合成变体。在广泛使用的基准数据集和设置上的评估表明,所提算法相比现有基线实现了优异性能,尤其在大规模数据集和高任务数量场景下。
核心贡献¶
- 原型样本合成:用少量合成原型代替大量原始样本,实现记忆压缩。
- 隐私保护:合成样本不直接存储原始数据,能保护用户隐私。
- 扰动增强机制:生成先前数据的合成变体,增强CL性能。
- 大幅降低存储需求:每个类仅需极少量样本即可达到与20+样本coreset相当的效果。
- 大规模任务验证:在大规模数据集和高任务数场景下验证了方法有效性。
为什么重要¶
持续学习的一个核心问题是记忆存储随任务数量线性增长,使得在长期运行中不可持续。该论文通过原型凝缩(exemplar condensation)实现指数级压缩——不是存储原始样本,而是存储能从中学到相同知识的合成原型。这对需要长期运行的智能体系统意义重大。
与端侧/移动端的相关性¶
端侧设备的存储空间极其有限,能存储的样本数量直接影响智能体的个性化能力。该方法的原型合成和隐私保护特性非常适合移动端——可以在不存储原始用户数据的情况下保持个性化记忆,这对隐私敏感的移动应用场景(如医疗助手、金融顾问)尤为重要。
参考文献¶
本文参考文献待从原文补充。