提出ℰ₀,一个连续化的离散扩散框架,用于视觉-语言-动作模型,以提升泛化能力和细粒度控制。该方法将动作生成为量化动作标记的迭代去噪过程,解决现有模型在符号对齐和离散控制上的不足,并引入球形视角扰动增强以提高对相机移动的鲁棒性。在LIBERO、VLABench和ManiSkill等数据集上验证,实现了最先进的性能。
- 提出ℰ₀,一个连续化的离散扩散框架,用于视觉-语言-动作模型,以提升泛化能力和细粒度控制。该方法将动作生成为量化动作标记的迭代去噪过程,解决现有模型在符号对齐和离散控制上的不足,并引入球形视角扰动增强以提高对相机移动的鲁棒性。在LIBERO、VLABench和ManiSkill等数据集上验证,实现了最先进的性能。
- 提出ℰ₀框架,支持任意细粒度的动作离散化,实现高精度动作表示,同时保持与预训练视觉-语言模型的兼容性。
- 引入球形视角扰动增强和相对球形嵌入机制,显式建模动态相机扰动,提升跨视角一致性和鲁棒性。
研究单位
中山大学,广东大数据分析与处理重点实验室,X-Era AI实验室,广东工业大学
论文概述
提出ℰ₀,一个连续化的离散扩散框架,用于视觉-语言-动作模型,以提升泛化能力和细粒度控制。该方法将动作生成为量化动作标记的迭代去噪过程,解决现有模型在符号对齐和离散控制上的不足,并引入球形视角扰动增强以提高对相机移动的鲁棒性。在LIBERO、VLABench和ManiSkill等数据集上验证,实现了最先进的性能。
核心贡献
- 提出ℰ₀框架,支持任意细粒度的动作离散化,实现高精度动作表示,同时保持与预训练视觉-语言模型的兼容性。
- 引入球形视角扰动增强和相对球形嵌入机制,显式建模动态相机扰动,提升跨视角一致性和鲁棒性。
- 通过多个模拟基准和真实机器人任务(包括Franka机械臂)的广泛实验,证明ℰ₀在14个多样化环境中超越基线模型平均10.7%的性能。
方法描述
基于PaliGemma视觉-语言模型主干网络,添加300M参数的动作专家模块。动作使用基于分位数的离散化,量化为2048个bins以减少异常值影响。训练中,对离散动作添加高斯噪声,模型通过交叉熵损失预测分类分布。推理采用多步迭代去噪,从噪声序列逐步恢复清晰动作,复用观察编码的键值缓存以提高效率。球形视角扰动通过3D点旋转重投影图像,结合可学习的偏移嵌入,增强视角不变性。
数据集与资源
数据集包括LIBERO(涵盖空间、物体、目标和长时程任务)、VLABench(需语言理解和常识推理)和ManiSkill(精细操作技能如插入和堆叠)。训练使用单块NVIDIA RTX RPO6000 GPU,批次大小32,训练30000步,学习率余弦衰减(峰值5×10⁻⁵,预热10000步),总时长24小时。
评估与结果
评估环境为LIBERO、VLABench和ManiSkill模拟器,以及Franka Research 3机械臂真实平台。指标为任务成功率(SR%),在各项任务子集和平均表现上报告。此外,进行相机扰动鲁棒性测试,通过动态改变相机位置和姿态评估跨视角泛化能力。