跳转至

Context Compression for Repository-Level Tasks — arXiv:2604.13725

核心贡献

本文是首个系统性实证研究,探讨上下文压缩(Context Compression)对仓库级代码智能任务的有效性。研究将 8 种压缩方法组织为三大范式:离散 token 序列、连续潜在向量、视觉 token,并在代码补全和生成任务上评估性能和效率。

关键发现: - 在 4x 压缩率下,连续潜在向量方法 BLEU 分数超越全上下文性能高达 28.3%,表明这些方法能过滤噪声而非简单截断 - 所有压缩范式均降低推理延迟 - 视觉和文本压缩在高位压缩率下均可实现高达 50% 的端到端延迟降低

为什么重要

仓库级代码智能任务要求 LLM 处理长多文件上下文,存在三大挑战: 1. 关键上下文被噪声掩盖 2. 因窗口限制被截断 3. 推理延迟增加

上下文压缩通过压缩输入来缓解这些风险,但其在代码任务中的适用性此前基本未被探索。本研究填补了这一空白。

与端侧/移动端相关性

  • 效率收益:端侧部署中推理成本至关重要,50% 延迟降低对移动/边缘设备意义重大
  • 内存受限场景:压缩后的紧凑表示减少内存占用,适合资源受限设备
  • 训练无关方法:部分方法无需训练,可直接应用于端侧部署

方法论

三大压缩范式: 1. 离散 Token 序列:传统 RAG/选择性截断 2. 连续潜在向量:将文本编码为稠密向量表示 3. 视觉 Token:将代码块转为图像 token

评估指标:任务性能(Benchmarks)+ 推理效率(延迟、Token 消耗)

实验结果

压缩范式 4x 压缩 BLEU 提升 延迟降低
连续潜在向量 +28.3% ~50%
视觉 Token 竞争性表现 ~50%
离散 Token 基线水平 <50%

参考文献

(参考文献待从原文补充)