跳转至

Hybrid Graph Context Compression — arXiv:2604.23277

核心贡献

本文提出一种训练无关、模型无关的压缩框架,通过结构化图先验选择紧凑句子集合。核心方法:

  1. 构建稀疏混合句子图,结合互 k-NN 语义边与短程序列边
  2. 通过聚类提取主题骨架(topic skeleton)
  3. 使用可解释评分排名句子,整合:任务相关性、簇代表性、桥接中心性、循环覆盖线索
  4. 带冗余抑制的预算贪婪选择,以原始顺序生成可读压缩上下文

为什么重要

现有压缩方法依赖训练压缩器、稠密检索风格选择或启发式剪枝,在严格 token 预算下难以同时保持任务相关性、主题覆盖和跨句连贯性。本方法通过结构化图先验解决了这一问题。

与端侧/移动端相关性

  • 训练无关:可直接部署,无需额外训练或微调
  • 推理效率:长文档基准上性能提升显著
  • 可解释性:评分机制透明,便于理解和调试

方法论

图构建

  • 语义边:互 k-NN 语义相似度
  • 序列边:短程上下文邻近

句子排名

可解释评分 = 任务相关性 × 簇代表性 × 桥接中心性 × 循环覆盖

压缩选择

预算贪婪算法 + 冗余抑制机制

实验结果

在四个数据集上与强基线对比,结果显示: - 提取式和抽象式基线均被超越 - 长文档基准上增益更大 - 保持跨句连贯性

参考文献

(参考文献待从原文补充)