跳转至

VehicleMemBench: Multi-User Long-Term Memory in In-Vehicle Agents — arXiv:2603.23840

摘要

VehicleMemBench 是一个多用户长程记忆基准,建立在可执行的座舱模拟环境中。随着智能座舱体验需求增长,座舱代理正从简单助手演进为长期陪伴伙伴。这要求代理持续建模多用户偏好,并在用户间偏好冲突和习惯变化中做出可靠决策。然而现有基准大多局限于单用户、静态问答场景,无法捕捉偏好的时序演化和多用户、工具交互的真实座舱环境特性。

VehicleMemBench 包含 23 个工具模块,每个样本包含超过 80 个历史记忆事件,通过比较行动后环境状态与预定义目标状态来评估工具使用和记忆,无需 LLM 或人工评分。实验表明,最强模型在直接指令任务上表现良好,但在涉及记忆演化的场景中表现挣扎——特别是当用户偏好动态变化时。即使先进的记忆系统也难以处理该环境中的领域特定记忆需求。

核心贡献

  1. 多用户长程记忆基准:首个覆盖多用户、动态偏好演化和工具交互的座舱记忆评估框架
  2. 可执行评估协议:通过环境状态对比实现客观可复现评估,绕过 LLM 评分或人工评分
  3. 80+ 记忆事件序列:每个样本包含丰富的历史记忆轨迹,支持长程记忆评估
  4. 偏好冲突处理:评估代理在多用户间偏好冲突场景下的决策能力

关键发现

  • 强大模型在直接指令任务上表现优异
  • 涉及记忆演化(偏好动态变化)的场景对现有系统挑战最大
  • 即使先进记忆系统也难以处理座舱领域特定记忆需求
  • 揭示了需要更鲁棒 specialized 记忆管理机制的必要性

与移动端/端侧的相关性

座舱环境是边缘端部署的典型场景——车载计算资源有限且需实时响应。VehicleMemBench 揭示了多用户场景下记忆系统在边缘端面临的独特挑战:动态偏好追踪、跨用户干扰、长期记忆压缩与检索的平衡。这对在受限资源下实现可靠的端侧长期陪伴代理具有重要参考价值。

参考文献

(参考文献待从原文补充)