跳转至

GroupMemBench: Multi-Party Conversation Memory — arXiv:2605.14498

摘要

大语言模型 Agent 日益承担个人助手和职场协作角色,其效用取决于能够跨长程对话提取、检索和应用信息的记忆系统。然而,现有记忆系统和基准测试均围绕二元单用户场景构建,与现实部署中跨越多个用户和渠道的群体交互模式存在显著差距。这一错位导致三个关键属性未被测试:多方信息整合、跨用户偏好对齐、动态身份记忆更新。

核心贡献

  1. GroupMemBench 基准:首个针对多方对话记忆的评估框架,包含群体记忆提取、跨用户偏好聚合、动态身份追踪三类任务。
  2. 多用户记忆探测协议:设计标准化的多轮多用户对话模板,测试 Agent 在复杂社交场景下的记忆能力。
  3. 记忆一致性指标:评估 Agent 对不同用户信息的记忆精度,以及跨用户的记忆一致性。
  4. 对比分析:对现有主流 Agent(GPT-4、Claude、Llama)进行系统评估,揭示群体记忆能力的普遍差距。

为什么重要

真实世界的 Agent 部署不是孤立对话——邮件、日历、文档协作等场景均涉及多人交互。现有 Agent 记忆研究几乎全部聚焦单用户,GroupMemBench 填补了多用户、多代理记忆这一空白,对构建真正实用的协作 Agent 至关重要。

与移动端/端侧的相关性

移动端个人助手需同时服务家庭成员或工作团队成员,群体记忆能力直接影响多用户场景下的体验。端侧部署时,多用户记忆的隐私隔离和高效存储是重要工程挑战。