跳转至

EPIC: Preference-Aligned Memory for On-Device RAG — arXiv:2605.18271

摘要

随着基于大语言模型(LLM)的个人 AI Agent 在端侧部署的需求日益增长,如何在严格的内存预算下高效管理个人上下文记忆成为核心挑战。传统 RAG 系统在处理个人上下文时面临严重的内存效率问题——存储所有原始数据成本过高,而简单压缩又会导致偏好对齐失效。

本文提出 EPIC(Efficient Preference-aligned Index Construction),将用户偏好作为个人上下文的紧凑稳定形式,贯穿整个 RAG pipeline 进行整合。EPIC 从原始数据中选择性保留偏好相关信息,并使检索结果向偏好对齐的上下文看齐。在对话、辩论、解释和推荐四个基准上的实验表明:EPIC 将索引内存减少 2404 倍,偏好跟随准确率提升 20.17 个百分点,检索延迟降低 33.33 倍。端侧实验中,EPIC 在流式更新下保持 1MB 以下内存占用和 29.35ms/查询的延迟。

核心贡献

  1. 偏好中心记忆构建:将用户偏好从原始上下文中提取为紧凑表示,作为端侧记忆的核心形式
  2. 偏好对齐的检索机制:检索时优先返回与用户偏好一致的上下文,而非单纯依赖语义相似度
  3. 流式更新支持:支持端侧环境中的增量式记忆更新,无需全量重建索引
  4. 超高效内存压缩:2404 倍索引内存压缩比,使端侧 RAG 成为可能

方法详解

问题定义

端侧 RAG 的核心瓶颈不是"如何检索",而是"记忆里应该存储什么"。用户偏好作为个人上下文的一种紧凑形式,具有两个关键特性: - 稳定性:相比原始对话历史,偏好变化缓慢,可作为长期记忆的锚点 - 区分性:不同用户的偏好差异显著,可用于个性化检索排序

EPIC 架构

原始数据 → 偏好提取 → 偏好索引 → 偏好对齐检索 → 偏好增强生成
              ↓
        偏好更新(流式)
  1. 偏好提取模块:从用户交互历史中自动识别和提取用户偏好表示
  2. 偏好索引构建:将偏好信息编码为紧凑向量,替代原始文档的大规模索引
  3. 偏好对齐检索:在检索阶段同时考虑语义相关性和偏好对齐度
  4. 流式更新机制:支持增量式偏好更新,无需重建整个索引

关键技术

  • 选择性保留:基于偏好相关度评分选择保留哪些原始上下文
  • 对齐损失:训练检索模型时显式优化偏好对齐目标
  • 量化压缩:对偏好向量进行极致量化,进一步降低存储开销

实验结果

指标 EPIC 最佳基线 提升
索引内存压缩比 1MB 2.4GB 2404×
偏好跟随准确率 - - +20.17pp
检索延迟 29.35ms ~1s 33.33×

四个基准覆盖:对话、辩论、解释、推荐

为什么重要

端侧 AI Agent 是隐私优先时代的必然趋势。EPIC 证明了"少即是多"——通过智能地选择存储内容而非存储所有内容,可以在极低资源占用下实现高质量的个性化记忆检索。这对移动端、 wearable 设备等资源受限场景具有重要意义。

与端侧/移动端的相关性

  • 1MB 内存占用:适合移动端和嵌入式系统部署
  • 29.35ms 延迟:满足实时交互的响应要求
  • 流式更新:支持端侧增量学习,无需完整重训练
  • 隐私优先:所有个人上下文存储在本地,不上传云端

参考文献

(参考文献待从原文补充)