跳转至

ICED: Concept-Level VLM Unlearning — arXiv:2605.14309

摘要

视觉-语言模型(VLMs)中的机器遗忘通常在图像或实例级别执行,难以精确移除目标知识而不影响无关语义。由于单个图像通常包含多个纠缠概念——包括要遗忘的目标概念和应保留的上下文信息——这一问题尤为突出。本文提出了一种用于 VLMs 的可解释概念级遗忘框架,通过多模态大语言 模型从遗忘集构建紧凑的任务特定概念词汇表。除了模态对齐外,视觉表示被分解为语义概念的稀疏非负组合,为细粒度知识操作提供了显式接口。基于这种分解,本文将遗忘表述为概念级优化,在选择性地抑制目标概念的同时保留实例内非目标语义和全局跨模态知识。在域内和域外遗忘设置上的广泛实验表明,该方法实现了更全面的目标遗忘、更好地保留了同一图像内的非目标知识,并与现有 VLM 遗忘方法相比保持了有竞争力的模型效用。

核心贡献

  1. 概念级遗忘框架:在概念级别而非图像/实例级别进行遗忘操作。
  2. 稀疏非负概念分解:将视觉表示分解为语义概念的稀疏非负组合,提供可解释接口。
  3. 选择性抑制:在抑制目标概念的同时保留实例内非目标语义和全局跨模态知识。
  4. 跨设置泛化:在域内和域外遗忘设置上均表现优异。

为什么重要

机器遗忘是记忆隐私的核心技术,ICED 在概念级别提供了细粒度的遗忘能力。这对于需要选择性记忆的 Agent 系统至关重要——既能移除特定有害知识,又能保留其他相关记忆。

与移动端/端侧的相关性

端侧部署的 VLMs 需要在本地进行隐私保护性遗忘,ICED 的概念级方法适合在资源受限的移动端实现细粒度的隐私控制。稀疏表示也降低了计算开销。