Continual Fine-Tuning of Large Language Models via Program Memory¶
论文基本信息¶
- arXiv ID: 2605.13162
- 作者: Hung Le, Svetha Venkatesh
- 机构: Deakin University
- 发表日期: 2026-05-13
- 类别: cs.LG (Machine Learning)
- 代码: 暂无公开代码链接
摘要¶
参数高效微调(PEFT),尤其是低秩适应(LoRA),已成为在有限算力下适配大语言模型的标准方法。然而,在持续学习场景中,模型需要用小数据集顺序更新,传统 LoRA 在快速适应与知识保留之间难以平衡。现有方法将低秩空间视为均质更新区域,缺乏短期更新如何随时间整合的机制调节能力。
本文提出 ProCL,一种基于"程序记忆"(Program Memory)的持续 LoRA 框架,灵感来自神经科学的互补学习系统(Complementary Learning Systems)。ProCL 将 LoRA 适配器组织为结构化的"程序记忆槽"(program memory slots),通过输入条件注意力动态检索这些槽,使相似输入重用共享适配器区域,同时保留未用容量供未来数据使用。槽与维持跨任务知识积累的分布式基础适配器结合,实现可塑性-稳定性的平衡。ProCL 完全在 LoRA 参数化范围内运行,不引入额外推理开销。在多个基准上的实验表明,相比其他持续 LoRA 策略,ProCL 在保持率上更优,灾难性遗忘更少。
核心贡献¶
1. 程序记忆槽(Program Memory Slots)¶
将 LoRA 适配器组织为可寻址的记忆槽,每个槽存储特定任务/领域的知识。检索时通过输入条件注意力选择最相关的槽。
2. 双重表示机制¶
- 局部适配器:快速、针对性地适应新任务(程序记忆槽)
- 分布式基础适配器:跨任务积累通用知识,维持长期稳定性
3. 输入条件注意力检索¶
给定新输入,动态计算与各记忆槽的注意力权重,只激活最相关的槽,避免记忆干扰。
4. 无额外推理开销¶
所有操作完全在原 LoRA 参数空间内完成,不增加推理时的计算负担。
为什么重要¶
持续微调是 LLM 在真实世界部署的核心挑战——模型必须不断从新数据中学习,但不能遗忘旧知识。传统 LoRA 在这方面表现不佳,因为它平等对待所有参数更新,没有机制区分"新知识"与"旧知识"的整合方式。
ProCL 通过引入程序记忆的抽象,使模型能够显式管理哪些知识应该快速访问、哪些应该稳定保持。这对移动端/端侧部署尤其有意义,因为这些场景下模型需要在资源受限的环境中持续学习新任务。
与移动端/端侧的相关性¶
- 端侧持续学习:移动设备上的模型需要从用户交互中持续学习(如键盘预测、语音识别个性化),但不能每次更新都重新训练。ProCL 的低开销持续学习机制直接适用于此场景。
- 参数效率:完全在 LoRA 参数空间内操作,额外参数量极低,对内存受限的端侧设备友好。
- 任务切换:程序记忆槽支持快速任务切换,对移动端多应用场景(如从一个域切换到另一个域)有潜在价值。
参考文献¶
本文参考文献待从原文补充。