跳转至

MemEye: Visual-Centric Multimodal Agent Memory Eval — arXiv:2605.15128

摘要

长期 Agent 记忆正变得越来越多元化,然而现有评估体系很少检验 Agent 是否保留了用于后续推理所需的视觉证据。在此之前,许多视觉基础问题仅靠描述文本或语言轨迹就能回答,无需真正保存细粒度视觉证据。同时,需要对变化视觉状态进行推理的更难案例在评估中基本缺失。因此,MemEye 提供了一个评估框架,通过强制要求 Agent 在纯文本信息不足以回答时必须保存和检索原始视觉数据,来系统性地评估多模态 Agent 记忆。

核心贡献

  1. 视觉中心评估范式:提出"视觉必要性"原则——只有当纯文本无法回答、必须依赖原始视觉证据时,才算真正测试了多模态记忆能力。
  2. MemEye Benchmark:包含三类任务——视觉状态追踪、空间关系推理、对象身份记忆,覆盖从简单到复杂的视觉记忆需求。
  3. 记忆保鲜度指标:定义并测量 Agent 随时间推移保留视觉细节的能力,区分"记得见过"与"记得看见了什么"。
  4. 多模态记忆探测协议:一套标准化的测试流程,用于评估记忆系统对图像、视频帧、截图等视觉输入的编码、存储、检索全流程。

为什么重要

当前多模态 Agent 评估过度依赖 caption 或摘要级别的记忆,而真实场景(如 GUI 代理、具身机器人、视觉文档理解)需要保留原始像素级视觉细节。本工作揭示了现有记忆系统在视觉持久性上的根本缺陷,为下一代多模态记忆系统提供了可靠的评估标准。

与移动端/端侧的相关性

移动端 Agent 常需处理截图、拍照、屏幕录制等视觉输入,端侧多模态记忆能力直接影响用户体验。MemEye 的评估标准可指导轻量级多模态记忆模块的设计,区分哪些视觉信息需要持久化、哪些可以压缩或丢弃。