一眼看懂
封面预览
暂无内容
- 暂无内容
- 提出了一个原则性的三阶段框架DLR,利用强化学习为VLA预训练生成高质量且多样化的机器人轨迹。
- 提供了理论分析,证明DLR能够保持发现模式的多样性,防止模式坍塌到单一解决方案。
Card 01
论文概述
论文概述
- 暂无内容
Card 02
研究单位
研究单位
香港科技大学、清华大学、武汉大学、中南大学、微软研究院
Card 03
论文概述
论文概述
该论文提出了一个名为“发现、学习和强化”(DLR)的三阶段框架,用于生成多样化且高质量的机器人轨迹,以扩大视觉-语言-动作(VLA)模型的预训练规模。该框架旨在通过强化学习(RL)生成数据,解决当前依赖人类遥操作数据成本高昂且行为多样性有限的问题。论文通过理论分析和实验验证了DLR在生成多样化轨迹和提高下游任务泛化能力方面的有效性。
Card 04
核心贡献
核心贡献
- 提出了一个原则性的三阶段框架DLR,利用强化学习为VLA预训练生成高质量且多样化的机器人轨迹。
- 提供了理论分析,证明DLR能够保持发现模式的多样性,防止模式坍塌到单一解决方案。
- 实验表明,DLR不仅能生成多样化的成功轨迹,还能使预训练的VLA模型在下游任务微调后表现更好。
Card 05
方法描述
方法描述
DLR框架包含三个阶段:
- 发现:使用基于变分自编码器(VAE)的信息论方法从人类演示中挖掘潜在的多样化行为模式。
- 学习:通过行为克隆训练一个条件策略来模仿这些发现的行为模式。
- 强化:使用稀疏的任务奖励在线优化每个条件策略,使不同模式收敛到各自对应的精炼解决方案。
该方法通过解耦多样性目标与策略的探索过程,将多样性目标仅应用于成功轨迹内的状态,避免了标准方法中探索与多样性奖励之间的冲突。
Card 06
数据集与资源
数据集与资源
数据集:LIBERO基准,特别是LIBERO-90用于预训练,LIBEROSpatial/LIBEROObject/LIBEROGoal/LIBEROLong用于下游评估。
训练资源:使用ResNet18作为视觉编码器,结合多层感知机(MLP)头输出动作。强化学习算法采用PPO。DLR设置模式数量\|Z\|=3,并使用均匀分布采样。在相同的预训练步数和数据量下与基线公平比较。
Card 07
评估与结果
评估与结果
评估环境:LIBERO模拟环境,包含多种操作任务,用于评估 lifelong learning 的知识迁移能力。
评估指标:
- 轨迹多样性指标:包括平均成对距离、终点方差、方向方差和路径长度方差。
- 下游任务成功率:在LIBERO-Spatial、LIBERO-Object、LIBERO-Goal和LIBERO-Long任务套件上的平均成功率,通过50次运行取平均。
- 数据缩放行为:通过绘制下游成功率随RL生成数据量变化的曲线来评估。