GAPE: Gated Adaptive Positional Encoding — arXiv:2605.10414
论文基本信息¶
- 标题: Remember to Forget: Gated Adaptive Positional Encoding
- arXiv ID: 2605.10414
- 发表日期: 2026-05-11
- 作者: Riccardo Ali, Alessio Borgi, Christopher Irwin, Mario Severino, Pietro Liò
- 方向: 记忆检索 / 记忆压缩
- 类别: cs.LG
摘要¶
旋转位置编码(RoPE)被广泛应用于现代大语言模型。然而当序列超出训练时见过的范围时,旋转相位会进入分布外区域,导致虚假的长程对齐、注意力弥散和检索退化。现有方法仅部分解决这些问题,通常以牺牲局部位置分辨率为代价换取长上下文稳定性。本文提出 GAPE(Gated Adaptive Positional Encoding),一种即插即用的位置编码增强方法,通过查询相关门控直接将内容感知偏置引入注意力 logits,同时保持旋转几何结构。GAPE 通过查询相关门收缩无关上下文、键相关门保留显著远距离 token。论文证明受保护 token 保持可访问性,未受保护远距离 token 的注意力质量按查询门的函数衰减。GAPE 可在标准缩放点积注意力内实现,在合成检索和长上下文基准测试中均优于旋转基线。
核心贡献¶
- GAPE 机制:查询相关门收缩无关上下文、键相关门保留显著远距离 token,实现内容感知的动态位置偏置
- 理论保证:证明受保护 token 保持可访问性,未保护远距离 token 的注意力质量按查询门的函数衰减
- 即插即用:无需改变旋转几何结构,可直接集成到标准注意力实现中
- 长程鲁棒性:在合成检索和长上下文基准测试中显著改善注意力锐度和检索精度
为什么重要¶
长上下文建模是 LLM 的核心能力之一,但 RoPE 在超出训练范围后会出现相位错位问题,影响关键信息的检索和利用。GAPE 通过内容感知的门控机制,在保持旋转编码优点的同时自适应地抑制无关位置的信息流动。这对 Agent 的记忆系统有直接意义——当记忆内容跨越很长上下文时,GAPE 能更有效地定位相关记忆而不被无关信息干扰。
与端侧/移动端的相关性¶
- 长上下文压缩:GAPE 改善长程依赖建模,可用于端侧设备上的记忆压缩表示
- 检索增强:改善长上下文中的精确检索,对端侧 RAG 场景有直接应用价值
- 内存效率:无需重新训练即可部署,适合移动端模型更新场景
- 边缘推理:长上下文稳定性改善使边缘设备能更可靠地处理长对话历史
参考文献¶
本文参考文献待从原文补充。