跳转至

Secure Forgetting: Privacy-Driven Unlearning in LLM Agents — arXiv:2604.00430


title: Secure Forgetting: A Framework for Privacy-Driven Unlearning in Large Language Model (LLM)-Based Agents arXiv: 2604.00430 date: 2026-04-01 tags: [agent-memory, memory-privacy, unlearning, llm-agent] reviewer: auto source: arXiv RSS/API


摘要

大型语言模型(LLM)智能体近期因LLM强大的推理能力而获得广泛关注。然而,随着LLM智能体日益融入现实应用,其积累敏感或过时知识的问题引发严重关切。该论文首次系统研究LLM智能体的"遗忘"(unlearning)问题,提出一个统一框架,将遗忘场景分为三类:状态遗忘(忘记特定状态或条目)、轨迹遗忘(忘记动作序列)和环境遗忘(忘记整个环境或任务类别)。论文还提出基于自然语言的遗忘方法,通过转换模型将高层遗忘请求转化为可操作的遗忘提示,并设计了遗忘推理对手(unlearning inference adversary)来评估框架的鲁棒性。

核心贡献

  1. 遗忘场景分类体系:首次系统地将LLM智能体遗忘分为状态遗忘、轨迹遗忘和环境遗忘三种上下文,为后续研究提供统一分类框架。
  2. 自然语言遗忘方法:训练一个转换模型,将高层遗忘请求(如"忘记某用户的所有信息")转化为可操作的遗忘提示,引导智能体通过受控遗忘过程。
  3. 遗忘推理对手:能够制作提示、查询智能体并观察其行为,以推断被遗忘知识的对抗性评估框架。
  4. 隐私保护验证:实验表明方法能有效遗忘目标知识,同时保持非目标任务的性能,并阻止对手推断被遗忘知识。

为什么重要

随着LLM智能体在医疗、金融、法律等敏感领域部署,智能体可能积累用户敏感信息、个人偏好甚至商业机密。传统的从头重训练或提示工程代价高昂,该框架提供了一种高效、可控的选择性遗忘机制。这与端侧隐私保护直接相关——在边缘设备上运行的智能体需要能够在本地完成敏感信息的遗忘操作,而不依赖云端重训练。

与端侧/移动端的相关性

端侧LLM智能体面临更严峻的隐私约束——数据不能离开设备,且用户对自身数据的控制权需求更强。Secure Forgetting框架的本地化遗忘机制对移动端/可穿戴设备上的AI助手尤为重要,用户应当能够请求智能体"忘记"特定会话或敏感信息,同时不影响智能体在其他任务上的能力。

参考文献

本文参考文献待从原文补充。