Geometry of Forgetting: Temporal Knowledge Drift as Independent Axis — arXiv:2605.09195
摘要¶
本文揭示了大语言模型中时间知识漂移(temporal knowledge drift)在残差流中编码为独立几何方向,与正确性和不确定性均正交。这解释了为何现有方法(token 熵、语义熵、CCS、SAPLMA)无法检测模型知识是否过时——它们在设计上就无法捕获 drift 信号。线性探测在 drift 标签上直接训练可达 AUROC 0.83-0.95,而上述方法均在 0.49-0.57 附近。机理分析发现 MLP 检索电路对过时回忆和虚构产生相同的动态(r > 0.81),解释了为何输出置信度无法区分二者。跨 cutoff 实验证实探测读取的是模型内部知识状态而非输入属性。
核心贡献¶
-
时间知识漂移的几何结构:漂移(fact 是否在训练后发生变化)在残差流中编码为独立方向,与正确性和不确定性均正交。这是从结构上解释了为什么无法检测过时知识。
-
线性探测的有效性:直接用漂移标签训练的线性探测在六个指令微调模型上均达 AUROC 0.83-0.95,而现有不确定性方法均近乎随机(0.49-0.57)。
-
五种几何验证:权重余弦(|cos| ≤ 0.14)、score 相关性(|r| ≤ 0.20)、双向零空间投影(|Δ| ≤ 0.008)、迭代零空间投影(k=10)、差异均值解离。
-
机理解释:MLP 检索电路对过时回忆和虚构产生相同动态(r > 0.81),说明输出置信度本质上无法区分二者。
-
跨模型验证:跨 cutoff 实验(固定输入、改变模型)确认探测读取的是模型内部知识状态而非输入特性(P(A>B) = 0.975-0.998,12 个模型对)。
为什么重要¶
LLM 在部署后知识会过时,但现有方法无法判断模型何时"自信地出错"。本文从几何角度揭示了这一问题的本质——drift 是一个独立的信息维度,与正确性正交。线性探测的高准确率意味着我们可以构建"drift 探测器"来监控模型知识的时效性,对需要可靠知识的应用场景(医疗、金融、法律)至关重要。
与移动端/端侧的相关性¶
移动端 AI 助手需要在设备上运行,但模型知识无法实时更新。本文证明可以通过探测模型内部状态来检测知识是否过时,为端侧知识管理提供了新思路——设备可以本地运行轻量级 drift 探测器,在模型知识过时风险高时提示用户更新,而非盲目信任模型输出。这对保护移动端用户免受过时知识误导有直接价值。
参考文献¶
(参考文献待从原文补充)