跳转至

GAPE: Gated Adaptive Positional Encoding — arXiv:2605.10414

论文基本信息

  • 标题: Remember to Forget: Gated Adaptive Positional Encoding
  • arXiv ID: 2605.10414
  • 发表日期: 2026-05-11
  • 作者: Riccardo Ali, Alessio Borgi, Christopher Irwin, Mario Severino, Pietro Liò
  • 方向: 记忆检索 / 记忆压缩
  • 类别: cs.LG

摘要

旋转位置编码(RoPE)被广泛应用于现代大语言模型。然而当序列超出训练时见过的范围时,旋转相位会进入分布外区域,导致虚假的长程对齐、注意力弥散和检索退化。现有方法仅部分解决这些问题,通常以牺牲局部位置分辨率为代价换取长上下文稳定性。本文提出 GAPE(Gated Adaptive Positional Encoding),一种即插即用的位置编码增强方法,通过查询相关门控直接将内容感知偏置引入注意力 logits,同时保持旋转几何结构。GAPE 通过查询相关门收缩无关上下文、键相关门保留显著远距离 token。论文证明受保护 token 保持可访问性,未受保护远距离 token 的注意力质量按查询门的函数衰减。GAPE 可在标准缩放点积注意力内实现,在合成检索和长上下文基准测试中均优于旋转基线。

核心贡献

  1. GAPE 机制:查询相关门收缩无关上下文、键相关门保留显著远距离 token,实现内容感知的动态位置偏置
  2. 理论保证:证明受保护 token 保持可访问性,未保护远距离 token 的注意力质量按查询门的函数衰减
  3. 即插即用:无需改变旋转几何结构,可直接集成到标准注意力实现中
  4. 长程鲁棒性:在合成检索和长上下文基准测试中显著改善注意力锐度和检索精度

为什么重要

长上下文建模是 LLM 的核心能力之一,但 RoPE 在超出训练范围后会出现相位错位问题,影响关键信息的检索和利用。GAPE 通过内容感知的门控机制,在保持旋转编码优点的同时自适应地抑制无关位置的信息流动。这对 Agent 的记忆系统有直接意义——当记忆内容跨越很长上下文时,GAPE 能更有效地定位相关记忆而不被无关信息干扰。

与端侧/移动端的相关性

  • 长上下文压缩:GAPE 改善长程依赖建模,可用于端侧设备上的记忆压缩表示
  • 检索增强:改善长上下文中的精确检索,对端侧 RAG 场景有直接应用价值
  • 内存效率:无需重新训练即可部署,适合移动端模型更新场景
  • 边缘推理:长上下文稳定性改善使边缘设备能更可靠地处理长对话历史

参考文献

本文参考文献待从原文补充。