跳转至

MAQIU: Memory-Augmented Query Intent Understanding for Chat-based Image Retrieval — arXiv:2605.17365

摘要

本文提出 MAQIU (Memory-Augmented Query Intent Understanding),解决对话式图像检索中用户查询意图的动态理解与更新问题。传统方法将所有历史查询拼接为长文本序列,或依赖大语言模型从历史重建当前查询——前者计算冗余,后者容易导致意图表征不一致。MAQIU 引入轻量级记忆模块,动态聚合和演化跨对话轮的查询意图语义表示,并使用记忆召回机制防止意图遗忘和增强长期语义完整性。此外,MAQIU 还将历史图像检索结果作为视觉指导,帮助模型强化跨轮相关性并细化当前视觉理解。在多个数据集上验证了方法的有效性。

核心贡献

  1. 轻量级记忆模块:动态聚合和演化跨对话轮的查询意图表征,避免长序列拼接
  2. 记忆召回机制:防止意图遗忘,增强长期语义完整性
  3. 视觉引导整合:将历史检索结果作为跨轮视觉参考,强化多模态关联
  4. 端到端可学习:模块可插入现有图像检索 pipeline

为什么重要

对话式图像检索是多模态 AI Agent 的典型场景——用户通过多轮对话逐步细化需求。关键挑战是如何在资源受限条件下维护跨轮意图一致性。MAQIU 的记忆模块提供了一种高效方案:不需要记住所有历史,而是选择性记住和检索意图相关的信息。这与人类认知中的"工作记忆"机制高度一致。对移动端 Agent 尤其有价值——移动设备屏幕有限,对话式交互是主流模式。

与端侧/移动端的相关性

  • 轻量级设计:模块化,可嵌入现有检索系统
  • 多模态记忆:文本(查询)+ 视觉(图像)混合记忆,符合移动端多模态交互场景
  • 意图理解:对话式 UI 的核心能力,适合手机语音/图像助手
  • 论文来自多所中国大学,方法有明确系统架构

参考文献

(参考文献待从原文补充)