一眼看懂
封面预览
提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。
- 提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。
- 解决标准经验回放中的 阶段饥饿 问题(短暂但因果关键的子技能采样不足)和 任务间预算分配不当 问题。
- 通过阶段感知和语义经验回放机制,在不改变策略架构的情况下显著提升模型对历史技能的保留能力。
Card 01
研究单位
研究单位
- Thrust of AI, HKUST(Guangzhou), Guangzhou, China
- AI2 Robotics, Shenzhen, China
Card 02
论文概述
论文概述
- 提出 PHASER 框架,一种针对 视觉-语言-动作 (VLA) 模型的架构无关持续学习方法,用于缓解灾难性遗忘。
- 解决标准经验回放中的 阶段饥饿 问题(短暂但因果关键的子技能采样不足)和 任务间预算分配不当 问题。
- 通过阶段感知和语义经验回放机制,在不改变策略架构的情况下显著提升模型对历史技能的保留能力。
Card 03
核心贡献
核心贡献
- 提出 PHASER 框架,通过显式建模操作轨迹的时间结构,克服了标准均匀经验回放的固有局限性。
- 引入 阶段中心容量分配,为所有子技能提供平等的内存支持,解决任务内阶段饥饿问题。
- 开发 多模态干扰路由 策略,动态优先回放遗忘风险高的历史阶段,解决任务间预算分配不当。
- 集成 Auto-PC 流水线,结合无监督动作信号变点检测与 VLM 语义验证,实现全自动的阶段边界提取。
Card 04
方法描述
方法描述
- 从 半马尔可夫决策过程 (SMDP) 视角重新解释 VLA 持续学习,将任务分解为时间扩展的子技能阶段。
- 为每个识别出的阶段分配固定的帧预算 K,通过时间子采样和水库采样填充,解耦内存支持与阶段时长。
- 使用三模态(语言、视觉、动作)原型距离计算干扰优先级评分,量化感知上下文重叠和动作分歧。
- 采用 Boltzmann 采样 在任务转换时根据干扰评分动态分配回放权重,仅在转换时计算一次,无额外前向传播成本。
- Auto-PC 利用动作信号变点检测提出候选边界,并通过 VLM 处理子采样视频进行语义验证和标记。
Card 05
数据集与资源
数据集与资源
- LIBERO-Goal (10个单阶段任务) 和 LIBERO-Long (10个多阶段组合任务) 基准数据集
- OpenVLA-OFT-7B, QwenGR00T-3B, QwenOFT-3B 模型骨干 (采用 rank-32 LoRA 微调)
- NVIDIA A800-SXM4-80GB GPUs (使用2卡数据并行)
Card 06
评估与结果
评估与结果
- 在相同回放预算下与 Sequential FT, ER, MIR, iCaRL 等基线方法进行对比评估。
- 主要评估指标为 平均成功率 (ASR) 和 负向后向转移 (NBT)。
- 在 LIBERO-Goal 上达到 87.8% 的最终 ASR,相较匹配预算的 ER 最高提升 31% 的 ASR。
- 实验证明框架对任务顺序排列具有鲁棒性,且 Auto-PC 自动提取的阶段边界性能与人工标注相当。