返回列表
VLA / Vision-Language-Action 每日论文卡
Continually Evolving Skill Knowledge in Vision Language Action Model
论文提出Stellar VLA框架,用于视觉-语言-动作模型(VLA)的持续模仿学习(CIL)。该框架通过联合学习任务中心表示和自演化知识空间,使模型能够在获取新技能的同时缓解对先前任务的遗忘。Stellar VLA包含两个变体:T-Stellar(任务级建模)和TS-Stellar(分层任务-技能建模),旨在实现知识驱动的高效持续学习。

论文详情

Continually Evolving Skill Knowledge in Vision Language Action Model

2025-11-22 · 原文 · 翻译 · 2511.18085

论文提出Stellar VLA框架,用于视觉-语言-动作模型(VLA)的持续模仿学习(CIL)。该框架通过联合学习任务中心表示和自演化知识空间,使模型能够在获取新技能的同时缓解对先前任务的遗忘。Stellar VLA包含两个变体:T-Stellar(任务级建模)和TS-Stellar(分层任务-技能建模),旨在实现知识驱动的高效持续学习。

5 分钟读完 6 张阅读卡 上海交通大学、上海创新研究院、剑桥大学、北京航空航天大学、AgiBot
一眼看懂 封面预览

论文提出Stellar VLA框架,用于视觉-语言-动作模型(VLA)的持续模仿学习(CIL)。该框架通过联合学习任务中心表示和自演化知识空间,使模型能够在获取新技能的同时缓解对先前任务的遗忘。Stellar VLA包含两个变体:T-Stellar(任务级建模)和TS-Stellar(分层任务-技能建模),旨在实现知识驱动的高效持续学习。

  • 论文提出Stellar VLA框架,用于视觉-语言-动作模型(VLA)的持续模仿学习(CIL)。该框架通过联合学习任务中心表示和自演化知识空间,使模型能够在获取新技能的同时缓解对先前任务的遗忘。Stellar VLA包含两个变体:T-Stellar(任务级建模)和TS-Stellar(分层任务-技能建模),旨在实现知识驱动的高效持续学习。
  • 提出Stellar VLA框架,通过自监督的知识演化循环实现任务知识的保留与发现。
  • 设计基于狄利克雷过程(DP)的知识空间,支持无限任务/技能聚类,自适应扩展知识表示。
Card 01 研究单位

研究单位

上海交通大学、上海创新研究院、剑桥大学、北京航空航天大学、AgiBot

Card 02 论文概述

论文概述

论文提出Stellar VLA框架,用于视觉-语言-动作模型(VLA)的持续模仿学习(CIL)。该框架通过联合学习任务中心表示和自演化知识空间,使模型能够在获取新技能的同时缓解对先前任务的遗忘。Stellar VLA包含两个变体:T-Stellar(任务级建模)和TS-Stellar(分层任务-技能建模),旨在实现知识驱动的高效持续学习。

Card 03 核心贡献

核心贡献

  1. 提出Stellar VLA框架,通过自监督的知识演化循环实现任务知识的保留与发现。
  2. 设计基于狄利克雷过程(DP)的知识空间,支持无限任务/技能聚类,自适应扩展知识表示。
  3. 引入知识引导的专家路由机制,在动作头中实现参数共享与任务特化的平衡,降低训练开销。
  4. 在LIBERO基准和真实任务中验证有效性,平均最终成功率相比基线提升超50%。
Card 04 方法描述

方法描述

  1. 知识空间建模

- T-Stellar使用狄利克雷过程混合模型(DPMM)构建离散任务级知识空间。

- TS-Stellar采用分层狄利克雷过程(HDP)建模任务-技能层次关系,捕获跨任务共享的子技能。

  1. 自监督学习

- 通过变分自编码器(VAE)学习任务中心表示,约束其聚合在知识空间内。

- 使用基于记忆的变分贝叶斯(memoVB)算法更新知识分布,支持增量学习。

  1. 专家路由

- 在动作头中集成混合专家(MoE)架构,动态分配专家。

- 设计知识关系嵌入(距离计算)和Top-K语义嵌入(可学习聚类嵌入)指导专家选择。

- 路由特征融合知识嵌入、噪声和语言令牌。

Card 05 数据集与资源

数据集与资源

  • 数据集

- 模拟:LIBERO基准(LIBERO-goal, LIBERO-long, LIBERO-30*),涵盖多样化目标、长时序推理和多任务场景。

- 真实世界:双臂机器人任务("Transfer Magic Stick"、"Pick up Bag"、"Handover Toy")。

  • 训练设置

- 采用经验回放(Experience Replay),仅存储1%过去数据以减少内存开销。

- 所有模型从零开始训练(非预训练)。

- 真实任务中使用5%回放率确保稳定性。

  • 资源

- 实验使用双臂机器人平台,观测来自头部和腕部摄像头,输出为关节姿态和夹爪状态。

Card 06 评估与结果

评估与结果

  • 评估环境

- 模拟:LIBERO仿真环境。

- 真实:人形机器人平台,配备多视角摄像头。

  • 评估指标

- FWT(前向迁移,越高越好):衡量学习新任务的能力。

- NBT(反向负迁移,越低越好):衡量遗忘程度。

- AUC(成功率曲线下面积,越高越好):反映整体性能稳定性。

- Final SR(最终平均成功率,越高越好):所有任务训练后的综合表现。

- 每个策略在先前任务上评估100次,构建成功率矩阵进行计算。