跳转至

SocialMemBench: Are AI Memory Systems Ready for Social Group Settings? — arXiv:2605.17789

论文基本信息

字段 内容
标题 SocialMemBench: Are AI Memory Systems Ready for Social Group Settings?
作者 Olukunle Owolabi
发表日期 2026-05-18
arXiv ID 2605.17789
类别 cs.CL, cs.AI

摘要(原文翻译)

AI 助手的记忆系统基于单用户对话构建,当应用于多方社交群体场景时出现系统性失效。这对当今正在构建的社交助手至关重要——嵌入聊天平台的多方行动智能体,以及需要将用户模型扩展到社会情境的主动个人助手。现有记忆基准评估二人对话或工作场所对话;没有针对多方社交群体的基准——在这里记忆必须将事实锚定在共享历史而非职业角色中,将群体规范与个体例外分离,并在成员离开后仍能正确归因。我们引入 SocialMemBench,一个包含五类原型(密友、家庭、休闲娱乐、兴趣社区、熟人网络)和三个群体规模层级(4-30 人)的人类验证合成社交群体网络基准,包含 430 个角色和 7,355 轮对话,产生 1,031 个问答对横跨九个问题类别。每个类别隔离一种架构能力,五种失效模式(单流融合、时间状态覆盖、大规模实体合并、跨人格知识缺失、规范-个体混淆)是可测试的假设;我们的两个研究探针 Subject-Mem 和 SMG 为其中两种提供了证据,其余三种仍是开放问题。全上下文 Gemini 2.5 Flash 参考仅达到 0.721,而盲审推理模型平均达 0.98(小网络),表明即使拥有完整访问权限该基准仍有实质难度。在所有 43 个网络上,四个开源记忆框架(Mem0、LangMem、Graphiti、Cognee)的表现聚集在 0.12-0.18 的问答加权范围,95% 置信区间重叠,远低于无压缩检索参考的 0.345 和匹配答题者全上下文参考的 0.369(GPT-4o-mini)。当前记忆系统存在可测量的差距。

核心贡献

  1. SocialMemBench 基准:首个多方社交群体记忆系统评估基准,覆盖五类社交网络原型和三个规模层级
  2. 九类问题类别:系统化隔离记忆架构的不同能力维度(事实锚定、规范vs例外分离、成员离开后的归因等)
  3. 五种失效模式识别:单流融合、时间状态覆盖、大规模实体合并、跨人格知识缺失、规范-个体混淆
  4. 多框架对比:对 Mem0、LangMem、Graphiti、Cognee 四个主流开源记忆框架的系统性评估
  5. 人类验证合成数据:确保评估数据质量和可重复性

为什么重要

现有 Agent 记忆系统几乎全部基于"单用户-单助手"的二人对话范式设计,而真实社交应用(群组聊天、多人协作、社交网络)需要多方共享记忆能力。SocialMemBench 揭示了一个基本问题:当前最流行的开源记忆框架(Mem0、LangMem、Graphiti、Cognee)在社交群体场景下性能仅 0.12-0.18,远低于无压缩检索基线(0.345)。这意味着社交记忆——维护共享历史、规范和跨人格知识的能力——是当前记忆系统的系统性盲区。对多智能体系统和社交 AI 应用的设计者而言,SocialMemBench 指出了下一代记忆系统必须解决的五个具体失效方向。

与移动端/端侧的相关性

移动端是社交助手的主要载体,社交记忆在端侧面临独特挑战:隐私要求限制了跨用户共享记忆的云端汇聚,多方对话的持续记忆消耗大量本地存储,群体规范和个体例外的区分对端侧计算资源敏感。SocialMemBench 的九类问题划分对端侧记忆存储策略具有直接参考价值——哪些能力首先失效,决定了在资源受限的移动端应优先实现哪些记忆功能。

方法细节

社交网络原型: - 密友圈(Close Friends) - 家庭(Family) - 休闲娱乐组(Recreational) - 兴趣社区(Interest Community) - 熟人网络(Acquaintance Network)

群体规模层级: 小(4-8人)、中(9-15人)、大(16-30人)

九类问题类别: 1. 共享历史事实召回 2. 群体规范识别 3. 个体例外分离 4. 成员离开后归因 5. 跨会话一致性 6. 实体合并准确性 7. 时间状态追踪 8. 跨人格知识推理 9. 规范-个体混淆检测

评估框架: 0-1 评分,0 = 完全失效,1 = 完全正确

关键发现

  1. 四个主流开源记忆框架在所有社交网络原型上均表现不佳(0.12-0.18),远低于无压缩检索基线
  2. 规模效应显著:大群体(16-30人)性能显著低于小群体(4-8人)
  3. "规范-个体混淆"和"跨人格知识缺失"是当前系统最难解决的问题
  4. 全上下文 Gemini 2.5 Flash 仅达 0.721,表明即使拥有完整信息也难以完全解决
  5. 无压缩检索基线(0.345)和匹配答题者全上下文参考(0.369)之间存在差距,说明检索而非推理是瓶颈

参考文献

参考文献待从原文补充。