EPIC: Preference-Aligned Memory for On-Device RAG — arXiv:2605.18271
摘要¶
随着基于大语言模型(LLM)的个人 AI Agent 在端侧部署的需求日益增长,如何在严格的内存预算下高效管理个人上下文记忆成为核心挑战。传统 RAG 系统在处理个人上下文时面临严重的内存效率问题——存储所有原始数据成本过高,而简单压缩又会导致偏好对齐失效。
本文提出 EPIC(Efficient Preference-aligned Index Construction),将用户偏好作为个人上下文的紧凑稳定形式,贯穿整个 RAG pipeline 进行整合。EPIC 从原始数据中选择性保留偏好相关信息,并使检索结果向偏好对齐的上下文看齐。在对话、辩论、解释和推荐四个基准上的实验表明:EPIC 将索引内存减少 2404 倍,偏好跟随准确率提升 20.17 个百分点,检索延迟降低 33.33 倍。端侧实验中,EPIC 在流式更新下保持 1MB 以下内存占用和 29.35ms/查询的延迟。
核心贡献¶
- 偏好中心记忆构建:将用户偏好从原始上下文中提取为紧凑表示,作为端侧记忆的核心形式
- 偏好对齐的检索机制:检索时优先返回与用户偏好一致的上下文,而非单纯依赖语义相似度
- 流式更新支持:支持端侧环境中的增量式记忆更新,无需全量重建索引
- 超高效内存压缩:2404 倍索引内存压缩比,使端侧 RAG 成为可能
方法详解¶
问题定义¶
端侧 RAG 的核心瓶颈不是"如何检索",而是"记忆里应该存储什么"。用户偏好作为个人上下文的一种紧凑形式,具有两个关键特性: - 稳定性:相比原始对话历史,偏好变化缓慢,可作为长期记忆的锚点 - 区分性:不同用户的偏好差异显著,可用于个性化检索排序
EPIC 架构¶
原始数据 → 偏好提取 → 偏好索引 → 偏好对齐检索 → 偏好增强生成
↓
偏好更新(流式)
- 偏好提取模块:从用户交互历史中自动识别和提取用户偏好表示
- 偏好索引构建:将偏好信息编码为紧凑向量,替代原始文档的大规模索引
- 偏好对齐检索:在检索阶段同时考虑语义相关性和偏好对齐度
- 流式更新机制:支持增量式偏好更新,无需重建整个索引
关键技术¶
- 选择性保留:基于偏好相关度评分选择保留哪些原始上下文
- 对齐损失:训练检索模型时显式优化偏好对齐目标
- 量化压缩:对偏好向量进行极致量化,进一步降低存储开销
实验结果¶
| 指标 | EPIC | 最佳基线 | 提升 |
|---|---|---|---|
| 索引内存压缩比 | 1MB | 2.4GB | 2404× |
| 偏好跟随准确率 | - | - | +20.17pp |
| 检索延迟 | 29.35ms | ~1s | 33.33× |
四个基准覆盖:对话、辩论、解释、推荐
为什么重要¶
端侧 AI Agent 是隐私优先时代的必然趋势。EPIC 证明了"少即是多"——通过智能地选择存储内容而非存储所有内容,可以在极低资源占用下实现高质量的个性化记忆检索。这对移动端、 wearable 设备等资源受限场景具有重要意义。
与端侧/移动端的相关性¶
- 1MB 内存占用:适合移动端和嵌入式系统部署
- 29.35ms 延迟:满足实时交互的响应要求
- 流式更新:支持端侧增量学习,无需完整重训练
- 隐私优先:所有个人上下文存储在本地,不上传云端
参考文献¶
(参考文献待从原文补充)