STL Memory Transfer: Short-Term to Long-Term KG Memory — arXiv:2605.22142
论文基本信息¶
- 标题: Short-Term-to-Long-Term Memory Transfer for Knowledge Graphs under Partial Observability
- arXiv ID: 2605.22142
- 发表日期: 2026-05-21
- 作者: Taewoon Kim, Vincent François-Lavet, Michael Cochez
- 类别: cs.LG (Machine Learning)
- 摘要来源: arXiv API
摘要(原文翻译)¶
部分可观测环境下的强化学习需要决定保留哪些信息,但大多数基于记忆的方法并未显式建模从短时记忆到长时记忆的符号观测迁移。本文在时序知识图谱记忆设置下研究这一迁移过程,并将其转化为神经符号值决策问题:对于每个观测到的三元组,智能体选择是保留还是丢弃它,再将其插入长期记忆。为处理可变大小的短时缓冲区,本文设计了基于每项的 Q-learning 架构,共享参数,并使用跨连续步骤匹配项的实用时序差分更新。在长时记忆容量为 128 的 RoomKG 基准上,学习的迁移决策优于符号和神经基线方法,包括带有时序注释的符号基线以及基于历史 LSTM/Transformer 的基线。在迁移策略的消融实验中,轻量级纯短时变体表现最佳,步级行为分析表明策略保留了与导航和查询相关的事实,同时丢弃了较低价值的候选事实,支持了在记忆约束下显式可解释的记忆决策。
核心贡献¶
- 神经符号迁移决策问题: 首次将短时到长时记忆的迁移建模为神经符号值函数决策问题,对每个观测三元组学习保留/丢弃策略
- 每项 Q-learning 设计: 使用共享参数的 per-item Q-learning 架构处理可变大小短时缓冲区,通过跨连续步骤匹配项的时序差分更新实现高效学习
- RoomKG 基准验证: 在部分可观测的时序知识图谱导航任务上验证,记忆容量 128 条件下学习迁移策略优于所有符号和神经基线
- 可解释的记忆决策: 步级分析显示策略保留导航/查询相关事实,丢弃低价值候选,实现显式可解释的记忆压缩决策
为什么重要¶
传统记忆系统要么固定短时缓冲策略(如 FIFO),要么依赖启发式规则。本文证明了学习的迁移策略可以超越手工设计的符号基线,包括那些使用时序注释的基线。这为端侧记忆系统的自适应压缩提供了新思路——不是被动遗忘,而是主动决策保留什么。轻量级纯短时变体的优秀表现也暗示选择性保留可能比复杂的长时记忆架构更有效。
与移动端/端侧记忆的相关性¶
- 自适应压缩: 移动端记忆容量受限,学习的迁移策略可以根据任务动态调整短时/长时分配
- 知识图谱记忆: 端侧知识图谱(如导航、AR 场景理解)需要高效的符号记忆压缩
- 神经符号方法: 轻量级 Q-learning 架构适合资源受限的端侧部署
参考文献¶
(参考文献待从原文补充)