跳转至

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

论文信息

字段 内容
作者 Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong
发表日期 2026-05-11
arXiv ID 2605.10094
类别 cs.RO
标签 agent-memory, memory-retrieval, VLA, test-time-adaptation, robotics

摘要(翻译)

视觉-语言-动作(VLA)模型显示出通用机器人操作的强大潜力,但其闭环可靠性在本地部署条件下通常会下降。现有评估通常将测试episode视为独立的零样本尝试。然而,实际机器人通常在相同或缓慢变化的环境中重复操作,成功的执行提供了可靠行为模式的环境验证证据。本文研究这种持久部署设置,探索部分能力的冻结VLA是否可以通过重用成功的测试时经验来提高可靠性。提出一种用于生成VLAs的在线成功记忆引导的测试时适应框架。在部署期间,机器人将进展校准的成功观察-动作片段存储在长期记忆中;在推理时,检索状态相关的动作块,通过轨迹级一致性过滤不一致候选,并将其聚合成精英动作先验。为将这一先验整合到动作生成中,引入了置信度自适应先验引导,将精英先验注入到流匹配动作采样器的中间状态,并根据检索置信度调整引导强度。这种设计让冻结的VLA能够利用环境特定的成功经验,同时保持观察条件生成细化。Retrieve-then-Steer机制实现了轻量级、非参数的测试时适应,无需参数更新。模拟和真实世界实验表明,在长时程和多阶段任务中任务成功和闭环稳定性得到改善。

核心贡献

  1. 持久部署设置研究:首个系统研究VLA在重复操作环境中如何利用成功经验进行测试时适应的工作

  2. 在线成功记忆框架

  3. 长期记忆存储成功观察-动作片段
  4. 推理时检索状态相关的动作块
  5. 轨迹级一致性过滤不一致候选

  6. Retrieve-then-Steer机制

  7. 检索(Retrieve):从成功记忆中提取状态相关的动作块
  8. 引导(Steer):将精英动作先验注入到动作生成过程
  9. 置信度自适应:根据检索置信度调整引导强度

  10. 流匹配动作采样器的中间状态注入:创新性地将记忆先验注入生成模型的中间层

  11. 非参数测试时适应:无需任何参数更新,仅通过记忆检索实现适应

为什么重要

本文为Agent记忆系统在机器人领域的应用提供了重要参考。传统的VLA评估假设测试episode是独立的,但实际部署中Agent会重复遇到相似场景。本文提出的成功记忆机制让Agent能够: - 记住哪些策略在特定状态下有效 - 通过经验积累不断提高可靠性 - 在不更新模型参数的情况下适应新环境

这对构建具有持续学习能力的机器人Agent记忆系统有直接价值。

技术细节

核心框架

成功记忆构建阶段:
  成功执行 → 观察-动作片段 → 进展校准 → 长期成功记忆存储

Retrieve阶段:
  当前状态 → 状态相关检索 → 动作块候选

Steer阶段:
  动作块候选 → 轨迹一致性过滤 → 精英动作先验 → 置信度自适应注入 → 流匹配采样器 → 最终动作

关键设计

  • 成功记忆条目:包含观察、动作和进展校准信息
  • 状态相关检索:根据当前观察检索相似的成功经验
  • 轨迹级一致性过滤:确保检索到的动作块在时间维度上连贯
  • 置信度自适应先验引导:根据检索置信度动态调整注入强度
  • 流匹配动作采样:生成模型基础,适配动作生成

实验设置

  • 模拟环境 + 真实机器人实验
  • 长时程任务、多阶段任务
  • 任务成功率、闭环稳定性指标

与移动端/端侧的相关性

  1. 边缘部署的VLA适应:成功记忆机制允许在边缘设备上实现非参数适应
  2. 低计算资源:无需梯度计算或参数更新,适合嵌入式系统
  3. 在线学习能力:通过经验积累持续改进,无需离线训练周期
  4. 实时性能:检索和先验注入的计算开销小,适合实时控制

参考

  • arXiv: https://arxiv.org/abs/2605.10094