返回列表
VLA / Vision-Language-Action 每日论文卡
Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories
暂无内容

论文详情

Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories

2025-11-24 · 原文 · 翻译 · 2511.19528

暂无内容

4 分钟读完 7 张阅读卡 香港科技大学、清华大学、武汉大学、中南大学、微软研究院
一眼看懂 封面预览

暂无内容

  • 暂无内容
  • 提出了一个原则性的三阶段框架DLR,利用强化学习为VLA预训练生成高质量且多样化的机器人轨迹。
  • 提供了理论分析,证明DLR能够保持发现模式的多样性,防止模式坍塌到单一解决方案。
Card 01 论文概述

论文概述

  • 暂无内容
Card 02 研究单位

研究单位

香港科技大学、清华大学、武汉大学、中南大学、微软研究院

Card 03 论文概述

论文概述

该论文提出了一个名为“发现、学习和强化”(DLR)的三阶段框架,用于生成多样化且高质量的机器人轨迹,以扩大视觉-语言-动作(VLA)模型的预训练规模。该框架旨在通过强化学习(RL)生成数据,解决当前依赖人类遥操作数据成本高昂且行为多样性有限的问题。论文通过理论分析和实验验证了DLR在生成多样化轨迹和提高下游任务泛化能力方面的有效性。

Card 04 核心贡献

核心贡献

  1. 提出了一个原则性的三阶段框架DLR,利用强化学习为VLA预训练生成高质量且多样化的机器人轨迹。
  2. 提供了理论分析,证明DLR能够保持发现模式的多样性,防止模式坍塌到单一解决方案。
  3. 实验表明,DLR不仅能生成多样化的成功轨迹,还能使预训练的VLA模型在下游任务微调后表现更好。
Card 05 方法描述

方法描述

DLR框架包含三个阶段:

  1. 发现:使用基于变分自编码器(VAE)的信息论方法从人类演示中挖掘潜在的多样化行为模式。
  2. 学习:通过行为克隆训练一个条件策略来模仿这些发现的行为模式。
  3. 强化:使用稀疏的任务奖励在线优化每个条件策略,使不同模式收敛到各自对应的精炼解决方案。

该方法通过解耦多样性目标与策略的探索过程,将多样性目标仅应用于成功轨迹内的状态,避免了标准方法中探索与多样性奖励之间的冲突。

Card 06 数据集与资源

数据集与资源

数据集:LIBERO基准,特别是LIBERO-90用于预训练,LIBEROSpatial/LIBEROObject/LIBEROGoal/LIBEROLong用于下游评估。

训练资源:使用ResNet18作为视觉编码器,结合多层感知机(MLP)头输出动作。强化学习算法采用PPO。DLR设置模式数量\|Z\|=3,并使用均匀分布采样。在相同的预训练步数和数据量下与基线公平比较。

Card 07 评估与结果

评估与结果

评估环境:LIBERO模拟环境,包含多种操作任务,用于评估 lifelong learning 的知识迁移能力。

评估指标:

  • 轨迹多样性指标:包括平均成对距离、终点方差、方向方差和路径长度方差。
  • 下游任务成功率:在LIBERO-Spatial、LIBERO-Object、LIBERO-Goal和LIBERO-Long任务套件上的平均成功率,通过50次运行取平均。
  • 数据缩放行为:通过绘制下游成功率随RL生成数据量变化的曲线来评估。