跳转至

Continual Fine-Tuning of Large Language Models via Program Memory

论文基本信息

  • arXiv ID: 2605.13162
  • 作者: Hung Le, Svetha Venkatesh
  • 机构: Deakin University
  • 发表日期: 2026-05-13
  • 类别: cs.LG (Machine Learning)
  • 代码: 暂无公开代码链接

摘要

参数高效微调(PEFT),尤其是低秩适应(LoRA),已成为在有限算力下适配大语言模型的标准方法。然而,在持续学习场景中,模型需要用小数据集顺序更新,传统 LoRA 在快速适应与知识保留之间难以平衡。现有方法将低秩空间视为均质更新区域,缺乏短期更新如何随时间整合的机制调节能力。

本文提出 ProCL,一种基于"程序记忆"(Program Memory)的持续 LoRA 框架,灵感来自神经科学的互补学习系统(Complementary Learning Systems)。ProCL 将 LoRA 适配器组织为结构化的"程序记忆槽"(program memory slots),通过输入条件注意力动态检索这些槽,使相似输入重用共享适配器区域,同时保留未用容量供未来数据使用。槽与维持跨任务知识积累的分布式基础适配器结合,实现可塑性-稳定性的平衡。ProCL 完全在 LoRA 参数化范围内运行,不引入额外推理开销。在多个基准上的实验表明,相比其他持续 LoRA 策略,ProCL 在保持率上更优,灾难性遗忘更少。

核心贡献

1. 程序记忆槽(Program Memory Slots)

将 LoRA 适配器组织为可寻址的记忆槽,每个槽存储特定任务/领域的知识。检索时通过输入条件注意力选择最相关的槽。

2. 双重表示机制

  • 局部适配器:快速、针对性地适应新任务(程序记忆槽)
  • 分布式基础适配器:跨任务积累通用知识,维持长期稳定性

3. 输入条件注意力检索

给定新输入,动态计算与各记忆槽的注意力权重,只激活最相关的槽,避免记忆干扰。

4. 无额外推理开销

所有操作完全在原 LoRA 参数空间内完成,不增加推理时的计算负担。

为什么重要

持续微调是 LLM 在真实世界部署的核心挑战——模型必须不断从新数据中学习,但不能遗忘旧知识。传统 LoRA 在这方面表现不佳,因为它平等对待所有参数更新,没有机制区分"新知识"与"旧知识"的整合方式。

ProCL 通过引入程序记忆的抽象,使模型能够显式管理哪些知识应该快速访问、哪些应该稳定保持。这对移动端/端侧部署尤其有意义,因为这些场景下模型需要在资源受限的环境中持续学习新任务。

与移动端/端侧的相关性

  • 端侧持续学习:移动设备上的模型需要从用户交互中持续学习(如键盘预测、语音识别个性化),但不能每次更新都重新训练。ProCL 的低开销持续学习机制直接适用于此场景。
  • 参数效率:完全在 LoRA 参数空间内操作,额外参数量极低,对内存受限的端侧设备友好。
  • 任务切换:程序记忆槽支持快速任务切换,对移动端多应用场景(如从一个域切换到另一个域)有潜在价值。

参考文献

本文参考文献待从原文补充。