Reasoning Portability: Guiding CL for MLLMs in RLVR Era — arXiv:2605.18903
摘要¶
视觉-语言模型在持续学习(VLM-CL)中需要持续适应新多模态任务同时保留先验知识。将多模态大语言模型(MLLM)与可验证奖励强化学习(RLVR)结合的新范式为持续适应提供了新的引导方式——推理能力的进步使得在推理层施加约束变得可行。本文形式化定义了「可移植性」(Portability):衡量先前策略在新任务上可复用程度的任务级别指标,并证明推理层信号在分布外样本上仍可靠而答案层信号则不然。基于此提出了推理可移植性(RDB-CL)方法,根据样本级推理可移植性动态调整 KL 正则化强度:对高可移植性样本施加紧约束以保留可复用推理,对低可移植性样本放松约束以允许探索新推理路径。在 MLLM 持续学习基准上,RDB-CL 一致性超越基线,vanilla RLVR 基线相比 Last 准确率提升 12.0%。
核心贡献¶
- 推理可移植性形式化:首次提出样本级「推理可移植性」概念,衡量先前策略推理行为在新任务上的可复用程度
- 推理层 vs 答案层信号:证明推理层信号在 OOD 样本上仍可靠,而答案层信号失效,为记忆复用提供新视角
- 动态 KL 正则化:根据每个样本的推理可移植性动态调整正则化强度,精准平衡记忆保留与新学习
- 12.0% 准确率提升:在 MLLM 持续学习上显著超越 RLVR 基线
为什么重要¶
这是首篇将「推理层记忆复用」概念引入持续学习的工作。传统方法关注样本或特征级别的知识迁移,而本文聚焦于推理策略的可移植性,对理解记忆系统中「什么是真正值得保留的知识」有重要启发。可移植性概念可推广到一般 Agent 记忆系统——记忆的价值不仅在于存储,更在于其推理结论在新场景下的可复用程度。
与移动端/端侧的相关性¶
- 端侧 MLLM 需要在资源受限条件下持续学习新任务,高推理可移植性的样本值得优先保留在记忆缓冲区
- 动态正则化强度可指导端侧计算预算的分配——对高可移植性样本投入更多记忆保持资源
- 推理层面的约束比参数层面的正则化更抽象,可能更适合在端侧实现模块化的记忆治理
方法细节¶
RDB-CL 的核心洞察:不是所有先前学到的知识都同等重要——推理策略中「如何从观察到结论」的思维链往往比具体答案更具可移植性。
推理可移植性定义:样本级指标,衡量当前样本上旧策略的推理路径在新任务上的适用程度。
动态平衡机制: - 高可移植性样本(旧推理仍有效):紧 KL 约束,强制新策略贴近旧策略,保留可复用推理 - 低可移植性样本(旧推理失效):松 KL 约束,允许新策略探索新推理路径
在多模态持续学习基准上的实验表明,这种推理层面的差异化处理比统一正则化更有效。
参考文献¶
见原文:https://arxiv.org/abs/2605.18903