一眼看懂
封面预览
论文提出了 OneVLA,一个统一的视觉-语言-动作(VLA)框架,旨在解决现有模型局限于单一任务(导航或操作)或需要特定模型变体的架构限制。
- 论文提出了 OneVLA,一个统一的视觉-语言-动作(VLA)框架,旨在解决现有模型局限于单一任务(导航或操作)或需要特定模型变体的架构限制。
- 该框架能够在单一模型中同时处理导航和操作任务,无需任务特定的模型变体,实现了跨任务的知识迁移和相互增强。
- 核心目标是打破导航与操作任务之间的架构壁垒,构建能够全面与环境交互的通用机器人系统。
Card 01
研究单位
研究单位
- Tsinghua University
- Pengcheng Laboratory
- Xiaomi EV
- Institute of Automation, Chinese Academy of Sciences
- Peking University
- HKUST(GZ)
Card 02
论文概述
论文概述
- 论文提出了 OneVLA,一个统一的视觉-语言-动作(VLA)框架,旨在解决现有模型局限于单一任务(导航或操作)或需要特定模型变体的架构限制。
- 该框架能够在单一模型中同时处理导航和操作任务,无需任务特定的模型变体,实现了跨任务的知识迁移和相互增强。
- 核心目标是打破导航与操作任务之间的架构壁垒,构建能够全面与环境交互的通用机器人系统。
Card 03
核心贡献
核心贡献
- 提出了 OneVLA 架构,这是首个能够同时执行导航和操作任务且无需任务特定模型变体的统一 VLA 模型。
- 设计了创新的统一动作头,通过拼接导航(4维)和操作(7维)的动作维度,实现了异构动作空间的统一处理。
- 引入了多阶段渐进式训练策略,结合精选数据构建和思维链微调,促进了不同任务域之间的有效相互增强。
- 通过实验证明了导航和操作任务在联合训练中能够相互受益,并在多个基准测试中达到了 SOTA 性能。
Card 04
方法描述
方法描述
- 采用 Qwen2.5-VL-3B-Instruct 作为统一视觉-语言骨干网络,包含 32 层视觉编码器和 36 层语言模型,用于提取跨任务特征。
- 设计了基于流匹配扩散过程的统一动作头,构建了一个 11 维的统一动作空间,并在训练中使用任务特定的权重掩码来独立计算损失。
- 实施了三阶段训练策略:第一阶段建立基础操作能力;第二阶段引入导航数据进行跨任务联合训练;第三阶段利用思维链数据增强推理能力。
Card 05
数据集与资源
数据集与资源
- 使用 VLN-CE 基准(包含 R2R 和 RxR 数据集)评估导航任务。
- 使用 SimplerEnv-Bridge 基准评估操作任务,包含 WidowX 机械臂的四个代表性任务。
- 模型规模为 3B 参数量。
- 训练过程中混合了开源跨具身操作数据集、VLN 数据集和通用视觉问答(VQA)数据。
Card 06
评估与结果
评估与结果
- 在模拟环境评估中,OneVLA 在 R2R 上达到 68.6%(提升 21.5%),在 RxR 上达到 58.2%(提升 31.9%),在 SimplerEnv 平均成功率上达到 64.5%(提升 29.1%),显著超越 UniVLA 和其他单任务模型。
- 消融实验显示,多阶段训练策略比单阶段训练性能提升超过 12.5%,且联合训练比单任务训练能带来显著的正向迁移效果。
- 在真实世界实验中,使用 Franka Research 3 机械臂和移动机器人平台,操作任务成功率达到 78.8%,导航任务成功率达到 77.5%,验证了模型的强泛化能力。