一眼看懂
封面预览
论文挑战了扩散模型视觉-语言-动作(VLA)策略需要多步去噪的直觉,提出在丰富的观测(图像、语言、状态)条件下,预测低维动作块的一步生成可以更简单有效。
- 论文挑战了扩散模型视觉-语言-动作(VLA)策略需要多步去噪的直觉,提出在丰富的观测(图像、语言、状态)条件下,预测低维动作块的一步生成可以更简单有效。
- 核心目标是证明,通过简单的训练时间分布调整(偏向高噪声状态),标准的流匹配目标即可实现强大的一步动作生成,无需复杂的蒸馏、教师模型或辅助损失函数。
- 论文通过受控的MNIST网格到序列实验和广泛的机器人策略实验,验证了条件-目标结构在VLA动作生成中的重要性。
Card 01
研究单位
研究单位
- University of Science and Technology of China
- Shanghai Innovation Institute
- Fudan University
Card 02
论文概述
论文概述
- 论文挑战了扩散模型视觉-语言-动作(VLA)策略需要多步去噪的直觉,提出在丰富的观测(图像、语言、状态)条件下,预测低维动作块的一步生成可以更简单有效。
- 核心目标是证明,通过简单的训练时间分布调整(偏向高噪声状态),标准的流匹配目标即可实现强大的一步动作生成,无需复杂的蒸馏、教师模型或辅助损失函数。
- 论文通过受控的MNIST网格到序列实验和广泛的机器人策略实验,验证了条件-目标结构在VLA动作生成中的重要性。
Card 03
核心贡献
核心贡献
- 将VLA动作生成重构为一个条件-目标问题,并设计了MNIST网格到序列任务作为受控探针,以隔离丰富条件、紧凑目标的结构特性。
- 展示了在标准LIBERO、LIBERO-Plus、LIBERO-Pro和真实机器人双臂YAM RSS评估中,简单的高噪声训练时间表可以使标准流匹配模型产生与多步解码相当甚至更优的一步策略。
- 通过学习速度场诊断,揭示了VLA模型噪声端点附近误差更低、对齐度更高的现象,并通过系统性消融实验确定了该行为何时成立。
- 实现了在1.4B VLM模型和30M动作头上,一步解码在LIBERO-Long达到95.6% 的成功率。
Card 04
方法描述
方法描述
- 使用条件流匹配框架,训练模型预测从噪声到干净动作的恒定速度场,并采用一个简单的噪声偏移公式来调整训练时间分布,使其偏向高噪声状态。
- 提出了一种轻量级VLA架构:使用强大的视觉-语言模型(基于SigLIP和PaliGemma)作为条件编码器,并连接一个轻量级的动作解码器,该解码器接收VLM令牌、机器人状态、时间嵌入和带噪动作令牌。
- 关键技术在于仅通过调整训练时间分布(如使用Beta分布或噪声偏移参数 α),使标准速度预测目标(无需额外目标)就能产生适合一步推理的模型,而无需改变模型结构或训练流程。
Card 05
数据集与资源
数据集与资源
- 模拟数据集:LIBERO(Spatial, Object, Goal, Long四个任务套件)、LIBERO-Plus、LIBERO-Pro。
- 真实机器人数据集:YAM RSS(双臂操作任务)。
- 受控实验数据集:MNIST(构建网格到序列任务)、CIFAR-10(用于对比诊断)。
- 模型规模:基础模型为1.4B参数的VLM,动作头为30M参数;消融实验使用更小的tiny模型。
- 训练资源:论文中未明确列出具体GPU型号和数量,但致谢了上海创新研究院提供的GPU资源。
Card 06
评估与结果
评估与结果
- 评估环境:在LIBERO系列模拟基准和真实机器人双臂YAM RSS挑战上进行评估。
- 主要评估指标:任务成功率(Success Rate %)。
- 关键实验结果:
- 标准LIBERO:一步策略与十步解码性能相当,使用α=4的高噪声偏移,一步策略在四个套件上的平均成功率显著优于均匀时间分布的十步策略。
- LIBERO-Plus:在18种可比较的配置中,一步解码的平均成功率比十步解码高出5.4个百分点。
- LIBERO-Pro:一步解码(44.2%)与十步解码(43.5%)的平均成功率几乎持平,显示了良好的鲁棒性。
- 真实机器人YAM RSS:一步解码在三个任务中的成功率(80%, 60%, 100%)均达到或超过了十步解码(80%, 35%, 50%)。
- LIBERO-Long:使用1.4B模型和30M动作头,一步解码成功率达到95.6%。