返回列表
VLA / Vision-Language-Action 每日论文卡
Co-training with Ego-centric Video and Demonstration for Robot Navigation Task
论文提出一个框架,将人类步行时拍摄的第一人称视角视频转换为可用于移动机器人模仿学习的数据集。

论文详情

Co-training with Ego-centric Video and Demonstration for Robot Navigation Task

2026-06-01 · 原文 · 翻译 · 2606.01951

论文提出一个框架,将人类步行时拍摄的第一人称视角视频转换为可用于移动机器人模仿学习的数据集。 研究旨在解决视觉-语言-动作(VLA)模型依赖大规模高质量机器人数据、收集成本高昂的问题。 核心目标是利用易于获取的人类视频数据,与机器人数据联合训练,提升模型的语言理解与动作生成鲁棒性。

5 分钟读完 6 张阅读卡 京都大学 信息学研究科
一眼看懂 封面预览

论文提出一个框架,将人类步行时拍摄的第一人称视角视频转换为可用于移动机器人模仿学习的数据集。

  • 论文提出一个框架,将人类步行时拍摄的第一人称视角视频转换为可用于移动机器人模仿学习的数据集。
  • 研究旨在解决视觉-语言-动作(VLA)模型依赖大规模高质量机器人数据、收集成本高昂的问题。
  • 核心目标是利用易于获取的人类视频数据,与机器人数据联合训练,提升模型的语言理解与动作生成鲁棒性。
Card 01 研究单位

研究单位

  • 京都大学 信息学研究科
  • 富士通有限公司 空间机器人研究中心
Card 02 论文概述

论文概述

  • 论文提出一个框架,将人类步行时拍摄的第一人称视角视频转换为可用于移动机器人模仿学习的数据集。
  • 研究旨在解决视觉-语言-动作(VLA)模型依赖大规模高质量机器人数据、收集成本高昂的问题。
  • 核心目标是利用易于获取的人类视频数据,与机器人数据联合训练,提升模型的语言理解动作生成鲁棒性。
Card 03 核心贡献

核心贡献

  • 提出一个将人类自中心行走视频转换为移动机器人模仿学习数据集的完整框架。
  • 设计了从人类运动中生成机器人兼容动作表示的轨迹转换方法(包含运动学投影与平滑处理)。
  • 通过真实机器人实验验证,联合训练人类衍生数据与机器人收集数据能显著提升语言条件导航性能。
Card 04 方法描述

方法描述

  • 使用基于SuperPointLightGlue的单目视觉里程计管道,从视频中估计6自由度相机运动轨迹。
  • 通过运动学投影将估计的3D运动投影为地面移动机器人兼容的平面运动(前向速度与角速度),并应用速度裁剪中值滤波卡尔曼滤波进行平滑处理。
  • 采用阈值离散化方法将连续速度信号转换为离散机器人动作,并使用模式滤波确保动作序列的时序一致性。
  • 基于VLA架构进行模仿学习,使用SigLIP2DINOv3作为冻结的视觉编码器,通过Transformer适配器融合特征,并以扩散Transformer(DiT) 生成动作序列。
Card 05 数据集与资源

数据集与资源

  • 机器人收集数据集:在室内实验室环境使用CobotMagic机器人收集,包含150次试验(针对3个目标位置),目标对象为红苹果。
  • 人类衍生数据集:使用iPhone录制人类执行相同任务的视频,包含240个视频,涵盖红苹果、绿苹果、橘子三种目标,分无干扰物与有干扰物两种场景。
  • 模型架构中,视觉-语言适配器与动作生成模块(DiT)均为8层Transformer,隐藏维度为512,前馈维度为2048。
  • 训练采用AdamW优化器,学习率1e-4,批量大小为4(梯度累积32步),共训练400,000迭代步。
Card 06 评估与结果

评估与结果

  • 评估在真实机器人CobotMagic上进行水果搜索导航任务,要求机器人根据语言指令导航至指定水果前方。
  • 主要评估指标为任务成功率,定义为机器人到达目标1米内并静止超过1秒。
  • 关键实验结果:

- 在训练过的起始位置,联合训练模型(“Ours”)在无干扰物设置下对所有目标对象成功率接近100%,在有干扰物设置下成功率仍达88.9%以上,远超仅用机器人或仅用人类数据训练的模型。

- 在未训练过的起始位置,仅用机器人数据训练的成功率为41.7%,仅用人类数据为0%,而联合训练模型成功率达75.0%

- 结果表明,联合训练结合了人类数据的泛化能力与机器人数据的动作生成稳定性,有效弥补了两者间的领域差距。