跳转至

摘要

记忆增强型LLM Agent通过跨会话存储、更新和复用信息,实现超越有限上下文窗口的交互。然而,在多会话环境中用强化学习训练此类Agent面临挑战——记忆将Agent的过去动作变成其未来环境的一部分。一旦不同rollout写入、更新或删除不同记忆,它们就不再共享相同的中间记忆状态,使得轨迹级比较从根本上变得不公平。这违反了GRPO等组相对方法的关键假设——rollout被视为从相同有效环境采样。本文提出 Memory-R2,其核心算法 LoGo-GRPO 结合局部和全局组相对优化:全局目标保持从长轨迹级奖励的端到端学习,局部rollout从相同中间记忆状态比较不同记忆操作结果,产生更公平的组比较和更精确的记忆构建监督信号。除信用分配外,Memory-R2通过共享参数协同学习设计联合优化记忆形成与记忆演化,采用渐进课程(8→16→32会话)稳定长记忆horizon上的多步RL。

核心贡献

  1. LoGo-GRPO算法:结合全局轨迹级学习和局部记忆操作比较,解决多会话记忆环境中的信用分配公平性问题
  2. 共享参数协同学习:事实提取器和记忆管理器从同一LLM骨干通过角色特定提示实例化,联合优化记忆形成与演化
  3. 渐进课程训练:从8会话逐步扩展到32会话,稳定长记忆horizon上的多步RL训练
  4. 长时域多会话验证:在长horizon多会话设置下为记忆增强型LLM Agent提供有效训练范式

为什么重要

记忆增强型Agent的RL训练长期受困于"记忆导致的状态不一致"问题——不同rollout的Agent看到不同的记忆历史,使得组相对方法失效。Memory-R2通过区分全局比较(跨轨迹)和局部比较(同一记忆状态下的不同操作),在保证训练信号质量的同时解决了这一根本性难题。这对端侧Agent的持续训练和记忆更新有重要启发。

与移动端/端侧相关性

  • 本地训练:方法专注于Agent本地记忆的RL训练,理论上可在端侧微调
  • 长horizon优化:渐进课程设计使训练过程更稳定,适合资源受限的端侧环境
  • 记忆管理:联合优化记忆形成与演化,为端侧记忆压缩提供参考

参考文献

(参考文献待从原文补充)