Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs¶
论文信息¶
| 字段 | 内容 |
|---|---|
| 作者 | Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong |
| 发表日期 | 2026-05-11 |
| arXiv ID | 2605.10094 |
| 类别 | cs.RO |
| 标签 | agent-memory, memory-retrieval, VLA, test-time-adaptation, robotics |
摘要(翻译)¶
视觉-语言-动作(VLA)模型显示出通用机器人操作的强大潜力,但其闭环可靠性在本地部署条件下通常会下降。现有评估通常将测试episode视为独立的零样本尝试。然而,实际机器人通常在相同或缓慢变化的环境中重复操作,成功的执行提供了可靠行为模式的环境验证证据。本文研究这种持久部署设置,探索部分能力的冻结VLA是否可以通过重用成功的测试时经验来提高可靠性。提出一种用于生成VLAs的在线成功记忆引导的测试时适应框架。在部署期间,机器人将进展校准的成功观察-动作片段存储在长期记忆中;在推理时,检索状态相关的动作块,通过轨迹级一致性过滤不一致候选,并将其聚合成精英动作先验。为将这一先验整合到动作生成中,引入了置信度自适应先验引导,将精英先验注入到流匹配动作采样器的中间状态,并根据检索置信度调整引导强度。这种设计让冻结的VLA能够利用环境特定的成功经验,同时保持观察条件生成细化。Retrieve-then-Steer机制实现了轻量级、非参数的测试时适应,无需参数更新。模拟和真实世界实验表明,在长时程和多阶段任务中任务成功和闭环稳定性得到改善。
核心贡献¶
-
持久部署设置研究:首个系统研究VLA在重复操作环境中如何利用成功经验进行测试时适应的工作
-
在线成功记忆框架:
- 长期记忆存储成功观察-动作片段
- 推理时检索状态相关的动作块
-
轨迹级一致性过滤不一致候选
-
Retrieve-then-Steer机制:
- 检索(Retrieve):从成功记忆中提取状态相关的动作块
- 引导(Steer):将精英动作先验注入到动作生成过程
-
置信度自适应:根据检索置信度调整引导强度
-
流匹配动作采样器的中间状态注入:创新性地将记忆先验注入生成模型的中间层
-
非参数测试时适应:无需任何参数更新,仅通过记忆检索实现适应
为什么重要¶
本文为Agent记忆系统在机器人领域的应用提供了重要参考。传统的VLA评估假设测试episode是独立的,但实际部署中Agent会重复遇到相似场景。本文提出的成功记忆机制让Agent能够: - 记住哪些策略在特定状态下有效 - 通过经验积累不断提高可靠性 - 在不更新模型参数的情况下适应新环境
这对构建具有持续学习能力的机器人Agent记忆系统有直接价值。
技术细节¶
核心框架¶
成功记忆构建阶段:
成功执行 → 观察-动作片段 → 进展校准 → 长期成功记忆存储
Retrieve阶段:
当前状态 → 状态相关检索 → 动作块候选
Steer阶段:
动作块候选 → 轨迹一致性过滤 → 精英动作先验 → 置信度自适应注入 → 流匹配采样器 → 最终动作
关键设计¶
- 成功记忆条目:包含观察、动作和进展校准信息
- 状态相关检索:根据当前观察检索相似的成功经验
- 轨迹级一致性过滤:确保检索到的动作块在时间维度上连贯
- 置信度自适应先验引导:根据检索置信度动态调整注入强度
- 流匹配动作采样:生成模型基础,适配动作生成
实验设置¶
- 模拟环境 + 真实机器人实验
- 长时程任务、多阶段任务
- 任务成功率、闭环稳定性指标
与移动端/端侧的相关性¶
- 边缘部署的VLA适应:成功记忆机制允许在边缘设备上实现非参数适应
- 低计算资源:无需梯度计算或参数更新,适合嵌入式系统
- 在线学习能力:通过经验积累持续改进,无需离线训练周期
- 实时性能:检索和先验注入的计算开销小,适合实时控制
参考¶
- arXiv: https://arxiv.org/abs/2605.10094