返回列表
VLA / Vision-Language-Action 每日论文卡
LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World
提出 LEGS (Loco-manipulation via Embodied Gaussian Splatting) 框架,这是一种混合仿真器,结合了网格前景与 3D Gaussian Splatting (3DGS) 背景,用于生成人形机器人全身操作训练数据。

论文详情

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

2026-05-31 · 原文 · 翻译 · 2606.01458

提出 LEGS (Loco-manipulation via Embodied Gaussian Splatting) 框架,这是一种混合仿真器,结合了网格前景与 3D Gaussian Splatting (3DGS) 背景,用于生成人形机器人全身操作训练数据。 解决了传统人形机器人遥操作数据采集成本高昂、耗时且难以适应新场景外观的问题,旨在通过纯合成数据微调视觉-语言-动作 (VLA) 模型。 利用程序化运动基元生成器大规模合成标注演示,无需人工遥操作即可训练策略,并实现了零样本迁移至真实机器人。

5 分钟读完 6 张阅读卡 Stanford University
一眼看懂 封面预览

提出 LEGS (Loco-manipulation via Embodied Gaussian Splatting) 框架,这是一种混合仿真器,结合了网格前景与 3D Gaussian Splatting (3DGS) 背景,用于生成人形机器人全身操作训练数据。

  • 提出 LEGS (Loco-manipulation via Embodied Gaussian Splatting) 框架,这是一种混合仿真器,结合了网格前景与 3D Gaussian Splatting (3DGS) 背景,用于生成人形机器人全身操作训练数据。
  • 解决了传统人形机器人遥操作数据采集成本高昂、耗时且难以适应新场景外观的问题,旨在通过纯合成数据微调视觉-语言-动作 (VLA) 模型。
  • 利用程序化运动基元生成器大规模合成标注演示,无需人工遥操作即可训练策略,并实现了零样本迁移至真实机器人。
Card 01 研究单位

研究单位

  • Stanford University
Card 02 论文概述

论文概述

  • 提出 LEGS (Loco-manipulation via Embodied Gaussian Splatting) 框架,这是一种混合仿真器,结合了网格前景与 3D Gaussian Splatting (3DGS) 背景,用于生成人形机器人全身操作训练数据。
  • 解决了传统人形机器人遥操作数据采集成本高昂、耗时且难以适应新场景外观的问题,旨在通过纯合成数据微调视觉-语言-动作 (VLA) 模型。
  • 利用程序化运动基元生成器大规模合成标注演示,无需人工遥操作即可训练策略,并实现了零样本迁移至真实机器人。
Card 03 核心贡献

核心贡献

  • 开发了完全替代遥操作的程序化仿真系统,在无需任何人工演示的情况下,生成的数据在所有任务和骨干模型上均匹配或超越遥操作数据的效果。
  • 提出了一种可大规模并行化的数据增强流程,通过解耦运动与外观,支持以极低的 GPU 成本将运动数据重渲染至新场景,成本比遥操作降低超过 15 倍
  • 在真实机器人上进行了广泛的评估(共计 1110 次试验),覆盖三个最先进的 VLA 模型骨干,验证了数据管道的优越泛化性。
Card 04 方法描述

方法描述

  • 采用视觉前端与物理后端解耦的架构:视觉前端将动态网格前景(机器人、物体)合成到静态 3DGS 背景上;物理后端使用 MuJoCo 引擎和 SONIC 全身控制器处理动力学。
  • 设计了确定性的两阶段颜色校准管道,对齐 SAM3D 网格渲染与 iPhone 扫描的 3DGS 背景,并将其映射到机器人部署相机 的色彩空间。
  • 利用程序化片段生成器,通过组合高层运动基元自动合成成功的任务轨迹,并利用仿真器的特权信息进行随机化以增强数据多样性。
Card 05 数据集与资源

数据集与资源

  • 对比数据集包括:合成数据集 LEGS (200)LEGS (50)、网格合成基线 SAM3D (200) 及真实遥操作数据 Teleop (50)
  • 微调的 VLA 骨干模型包括:$\psi_0$$\pi_{0.5}$GR00T N1.6
  • 实验平台为 Unitree G1 人形机器人,配备 Intel RealSense D435 相机;数据生成计算资源使用单张 RTX 4090 GPU。
Card 06 评估与结果

评估与结果

  • 评估环境设定为三个难度递增的抓取放置任务(纯操作、简单全身操作、复杂长时序操作),主要评估指标为任务成功率 (TSR)。
  • 实验结果表明,LEGS 数据训练的策略在所有实验中均优于或匹配遥操作基线,特别是在长时序任务中遥操作成功率降为 0%,而 LEGS 仍能保持 20%-60% 的成功率。
  • 在外观随机化实验中,面对物体和场景同时变化的情况,仅依赖遥操作数据的策略完全失败,而经过重渲染增强的 LEGS-aug 策略仍保持较高的成功率,证明了其对新场景的鲁棒适应性。