返回列表
VLA / Vision-Language-Action 每日论文卡
PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models
提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。

论文详情

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

2026-06-02 · 原文 · 翻译 · 2606.03598

提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。 解决标准经验回放中的 阶段饥饿 问题(短暂但因果关键的子技能采样不足)和 任务间预算分配不当 问题。 通过阶段感知和语义经验回放机制,在不改变策略架构的情况下显著提升模型对历史技能的保留能力。

4 分钟读完 6 张阅读卡 Thrust of AI, HKUST(Guangzhou), Guangzhou, China
一眼看懂 封面预览

提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。

  • 提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。
  • 解决标准经验回放中的 阶段饥饿 问题(短暂但因果关键的子技能采样不足)和 任务间预算分配不当 问题。
  • 通过阶段感知和语义经验回放机制,在不改变策略架构的情况下显著提升模型对历史技能的保留能力。
Card 01 研究单位

研究单位

  • Thrust of AI, HKUST(Guangzhou), Guangzhou, China
  • AI2 Robotics, Shenzhen, China
Card 02 论文概述

论文概述

  • 提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。
  • 解决标准经验回放中的 阶段饥饿 问题(短暂但因果关键的子技能采样不足)和 任务间预算分配不当 问题。
  • 通过阶段感知和语义经验回放机制,在不改变策略架构的情况下显著提升模型对历史技能的保留能力。
Card 03 核心贡献

核心贡献

  • 提出 PHASER 框架,通过显式建模操作轨迹的时间结构,克服了标准均匀经验回放的固有局限性。
  • 引入 阶段中心容量分配,为所有子技能提供平等的内存支持,解决任务内阶段饥饿问题。
  • 开发 多模态干扰路由 策略,动态优先回放遗忘风险高的历史阶段,解决任务间预算分配不当。
  • 集成 Auto-PC 流水线,结合无监督动作信号变点检测与 VLM 语义验证,实现全自动的阶段边界提取。
Card 04 方法描述

方法描述

  • 半马尔可夫决策过程 (SMDP) 视角重新解释 VLA 持续学习,将任务分解为时间扩展的子技能阶段。
  • 为每个识别出的阶段分配固定的帧预算 K,通过时间子采样和水库采样填充,解耦内存支持与阶段时长。
  • 使用三模态(语言、视觉、动作)原型距离计算干扰优先级评分,量化感知上下文重叠和动作分歧。
  • 采用 Boltzmann 采样 在任务转换时根据干扰评分动态分配回放权重,仅在转换时计算一次,无额外前向传播成本。
  • Auto-PC 利用动作信号变点检测提出候选边界,并通过 VLM 处理子采样视频进行语义验证和标记。
Card 05 数据集与资源

数据集与资源

  • LIBERO-Goal (10个单阶段任务) 和 LIBERO-Long (10个多阶段组合任务) 基准数据集
  • OpenVLA-OFT-7B, QwenGR00T-3B, QwenOFT-3B 模型骨干 (采用 rank-32 LoRA 微调)
  • NVIDIA A800-SXM4-80GB GPUs (使用2卡数据并行)
Card 06 评估与结果

评估与结果

  • 在相同回放预算下与 Sequential FT, ER, MIR, iCaRL 等基线方法进行对比评估。
  • 主要评估指标为 平均成功率 (ASR)负向后向转移 (NBT)
  • LIBERO-Goal 上达到 87.8% 的最终 ASR,相较匹配预算的 ER 最高提升 31% 的 ASR。
  • 实验证明框架对任务顺序排列具有鲁棒性,且 Auto-PC 自动提取的阶段边界性能与人工标注相当。