MemConflict: Evaluating Long-Term Memory Systems Under Memory Conflicts — arXiv:2605.20926
论文基本信息¶
| 字段 | 内容 |
|---|---|
| 标题 | MemConflict: Evaluating Long-Term Memory Systems Under Memory Conflicts |
| 作者 | Zhen Tao, Jinxiang Zhao, Peng Liu |
| 发表日期 | 2026-05-20 |
| arXiv ID | 2605.20926 |
| 类别 | cs.IR (Information Retrieval) |
摘要(原文翻译)¶
长期记忆系统使基于大语言模型(LLM)的会话代理能够跨多会话交互保留、检索和应用用户特定信息。然而,现有评估主要考察结果级性能或时间更新,对系统在冲突备选方案下如何检索和排序时间有效、事实正确、上下文适用的记忆证据提供有限洞察。为解决这一差距,我们提出 MemConflict——一个将记忆有效性视为查询条件适应度问题的诊断框架。MemConflict 形式化定义了动态冲突、静态冲突和条件冲突,涵盖时间有效性、事实正确性和上下文适用性。它从结构化用户画像模拟受控的长时序历史,引入跨会话冲突,并注入语义相似的干扰项以在记忆候选间制造竞争。由此产生的多会话对话基准支持对最终答案的黑盒评估以及对支撑记忆检索和排序的白盒分析。对六种代表性长期记忆系统的实验表明,不同冲突类型下表现不均,答案正确性往往与记忆检索和排序的评估结果不一致。敏感性分析揭示,更长的历史、干扰项、隐式查询和更大的冲突距离会降低性能。诊断分析表明,失败源于缺失支撑记忆以及对检索记忆的低效利用。总体而言,MemConflict 通过检索感知、冲突感知的可靠性评估推动了原则性长期记忆治理。
核心贡献¶
- MemConflict 诊断框架:首次将记忆有效性形式化为查询条件适应度问题,区分动态冲突(随时间变化的事实)、静态冲突(跨会话不一致)和条件冲突(上下文适用性)
- 受控长时序历史模拟:从结构化用户画像生成多会话对话,支持系统化注入冲突和干扰项
- 双重评估机制:黑盒(最终答案正确性)+ 白盒(记忆检索和排序质量)
- 六系统对比分析:覆盖主流记忆框架(Mem0、LangMem、Graphiti、Cognee 等),揭示不同冲突类型下的不均衡表现
- 失效根因诊断:识别两类核心失效模式——缺失支撑记忆、已检索记忆的低效利用
为什么重要¶
现有长期记忆评估存在根本缺陷:仅考察最终答案质量,无法诊断记忆系统在冲突情境下如何权衡不同记忆证据。MemConflict 填补了这一空白,揭示了一个关键洞察——答案正确性 ≠ 记忆检索质量,两者可能严重脱节。这意味着仅优化答案正确率的记忆系统可能在记忆检索层面存在根本性缺陷。对 Agent 记忆系统的设计者而言,MemConflict 提供了一套可重复的冲突情境测试协议,能在部署前发现记忆治理的系统性漏洞。
与移动端/端侧的相关性¶
移动端 Agent 面临独特的记忆冲突压力:用户在不同设备(手机、平板、手表)上产生的记忆碎片需要在端侧汇聚和协调,且端侧存储容量有限导致更频繁的记忆压缩和干扰。MemConflict 的冲突分类(动态/静态/条件)对设计端侧记忆淘汰策略具有直接指导意义——哪个冲突类型最先触发失效,决定了优先级和保留策略。端侧记忆系统的评估应参照 MemConflict 的方法,在冲突注入下测量检索和排序的退化曲线。
方法细节¶
冲突类型形式化: - 动态冲突:随时间变化的事实(如用户地址、职业)在跨会话中产生版本冲突 - 静态冲突:历史记录内部的不一致(如同一次会话中的矛盾陈述) - 条件冲突:特定上下文下适用的事实在另一上下文被错误调用
Benchmark 构建: - 从结构化用户画像(兴趣、职业、社会关系)模拟多会话对话 - 注入语义相似干扰项制造记忆候选间的竞争 - 控制冲突距离(Conflict Distance)衡量记忆检索的退化程度
评估指标: - Black-box:最终答案正确率(F1、BLEU) - White-box:记忆检索 Precision@K、排序相关性、冲突检测率
实验发现¶
- 主流记忆框架在冲突情境下均存在显著性能退化
- 隐式查询和长历史是最严重的性能降解因素
- 答案正确性指标与记忆检索指标存在系统性脱节——高答案正确率不等于高记忆检索质量
- 更大的冲突距离导致近线性性能退化
- 检索失败的主要原因是支撑记忆缺失,而非记忆噪声干扰
参考文献¶
参考文献待从原文补充。