MEME: Multi-Entity & Evolving Memory Evaluation — arXiv:2605.12477
论文基本信息¶
- 标题: MEME: Multi-entity & Evolving Memory Evaluation
- arXiv ID: 2605.12477
- 发表日期: 2026-05-12
- 作者: Seokwon Jung, Alexander Rubinstein, Arnas Uselis
- 类别: cs.LG (Machine Learning)
- 摘要来源: arXiv API
摘要(原文翻译)¶
基于 LLM 的智能体越来越多地在持续环境中运行,必须跨多会话存储、更新和推理信息。现有基准测试仅评估单实体更新,而 MEME 定义了六个任务,覆盖多实体和动态演化轴的完整空间,包括先前工作未评分的三个任务:Cascade 和 Absence(依赖推理)以及 Deletion(移除后状态)。在 100 个受控情节上评估三种记忆范式的六个记忆系统后,发现所有系统在默认配置下的依赖推理上均崩溃(Cascade 准确率 3%,Absence 准确率 1%),尽管静态检索性能充足。提示优化、更深层检索、减少填充噪声以及更强的 LLM 均未能弥补这一差距。只有与 Claude Opus 4.7 配对的文件型智能体在一定程度上缩小了差距,但成本约为基线的 70 倍,表明当前弥补差距依赖于在大规模部署中不实际的配置。代码和数据发布于项目页面。
核心贡献¶
- 多实体+演化联合评估框架: 首次系统评估记忆系统在多实体(多个相关联的信息主体)和动态演化(信息随时间变化/删除)两个维度上的联合表现,填补了记忆评估的空白
- 六个评测任务: 定义了覆盖单实体/多实体×静态/演化轴的六任务框架,包括依赖推理(Cascade/Absence)和删除后状态(Deletion)等新任务
- 全面溃败的基准发现: 所有六记忆系统在依赖推理上平均准确率仅 1-3%,揭示了当前记忆系统处理信息关联和演化关系的根本缺陷
- 成本-性能权衡揭示: 只有顶级 LLM(Claude Opus 4.7)+文件架构能部分解决,但成本达基线 70 倍,实用化仍有距离
为什么重要¶
现有记忆基准测试(如 MemoryGym)只关注单实体信息更新,无法反映真实世界多智能体、多用户场景中的记忆挑战。MEME 揭示了一个关键问题:当前的记忆系统在建模信息之间的依赖关系和演化动态上存在根本性缺陷。这一发现对设计下一代 Agent 记忆系统具有重要指导意义——不仅需要存储信息,还需要维护信息之间的关系网络和处理动态变化。
与移动端/端侧记忆的相关性¶
- 端侧记忆系统的核心挑战: 移动端多用户、多任务场景下,记忆系统需要处理与 MEME 类似的多实体依赖问题
- 评估标准: MEME 为端侧记忆系统提供了严谨的评测标准,尤其是在依赖推理方面
- 成本敏感的端侧部署: 高性能记忆系统的高成本问题(70倍基线)在端侧部署中尤为突出,轻量级解决方案是移动端研究的重要方向
参考文献¶
(参考文献待从原文补充)