跳转至

RISE: Zeroth-Order Adaptation May Forget Less — arXiv:2605.10658

论文基本信息

  • 标题: Why Zeroth-Order Adaptation May Forget Less: A Randomized Shaping Theory
  • arXiv ID: 2605.10658
  • 发表日期: 2026-05-11
  • 作者: Yao Shu, Jian Mu, Zhongxiang Dai
  • 方向: 持续学习 / 记忆压缩
  • 类别: cs.LG

摘要

持续学习要求模型在新任务适应时不损害已习得的能力。现有研究表明,低查询量的零阶(ZO)适应比一阶(FO)下降保留得更好,但通常将 ZO 视为带噪声的 FO 估计无法解释这一现象。本文提出局部随机梯度塑形(randomized gradient-shaping)理论:有限差分暴露的原始形状与 FO 均对齐,而范数匹配的比较器固定了期望的平方适应范数。在此受控比较下,遗忘取决于适应形状如何暴露保留曲率。对于范数匹配的 ZO,期望形状化保留曲率服从精确恒等式,在收缩各向异性分量同时保持各向同性保留地板。将该恒等式投影到入梯度上得到可观测的 FO-ZO 二次遗忘间隙:ZO 在 FO 方向具有高于平均的保留曲率时精确改善平均遗忘。RISE 算法将校准后的 ZO 形状应用于精确 FO 梯度的参数块内,在稳定性-可塑性权衡中减少 FO 的保留暴露。

核心贡献

  1. 随机梯度塑形理论:提出局部随机梯度塑形分析框架,解释为什么零阶适应可能比一阶遗忘更少
  2. 精确遗忘恒等式:推导了范数匹配 ZO 的期望形状化保留曲率的精确恒等式,量化各向同性/各向异性分量
  3. FO-ZO 遗忘间隙公式:建立可观测的二次遗忘间隙,表明 ZO 通过 query 依赖的曲率超量分数改善遗忘
  4. RISE 算法:将校准的 ZO 形状应用于 FO 梯度的参数块级传输,结合精确梯度去除有限差分平滑偏差

为什么重要

持续学习中的灾难性遗忘是一个核心挑战。本文从理论层面揭示了零阶优化方法的固有特性——有限差分查询天然暴露了一种"形状",这种形状在保留曲率方向上收缩噪声,从而减少对已有知识的干扰。这为设计更安全的在线适应方法提供了理论基础。RISE 算法的参数块级设计也提供了实践指导。

与端侧/移动端的相关性

  • 低查询量适应:ZO 方法仅需前向传播(无梯度反向),适合计算资源受限的端侧场景
  • 块级更新:RISE 的参数块设计允许选择性更新,适合端侧增量学习
  • 稳定性-可塑性权衡:对移动端持续适应的场景(如个人助手随用户习惯调整)有直接意义
  • 无梯度方法:移动设备上的联邦学习场景可受益于无需梯度传输的更新机制

参考文献

本文参考文献待从原文补充。