返回列表
VLA / Vision-Language-Action 每日论文卡
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。

论文详情

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

2025-11-25 · 原文 · 翻译 · 2511.19861

本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。

5 分钟读完 6 张阅读卡 GigaAI
一眼看懂 封面预览

本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。

  • 本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。
  • 提出GigaWorld-0作为数据引擎,整合视频生成与3D物理仿真,解决具身AI的数据瓶颈问题。
  • 设计GigaWorld-0-Video系列模型,支持文本控制的外观、视角和动作迁移,以及多视角生成。
Card 01 研究单位

研究单位

GigaAI

Card 02 论文概述

论文概述

本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。

Card 03 核心贡献

核心贡献

  1. 提出GigaWorld-0作为数据引擎,整合视频生成与3D物理仿真,解决具身AI的数据瓶颈问题。
  2. 设计GigaWorld-0-Video系列模型,支持文本控制的外观、视角和动作迁移,以及多视角生成。
  3. 开发GigaWorld-0-3D模块,实现几何一致的3D场景重建、物理属性标注和可执行动作规划。
  4. 构建GigaTrain训练框架,利用FP8精度和稀疏注意力优化大规模视频生成效率。
  5. 通过下游任务验证,证明生成数据能提升VLA模型在真实机器人任务中的性能。
Card 04 方法描述

方法描述

  1. GigaWorld-0-Video-Dreamer:基于流匹配和MoE架构的视频基础模型,支持图像-文本到视频生成。
  2. GigaWorld-0-Video-AppearanceTransfer:通过轻量控制分支实现文本引导的纹理、材质和光照编辑。
  3. GigaWorld-0-Video-ViewTransfer:结合双条件控制,生成新视角视频并同步调整机器人动作。
  4. GigaWorld-0-Video-MimicTransfer:将第一人称人类操作视频转换为机器人可执行轨迹。
  5. GigaWorld-0-3D:通过3D高斯溅射重建背景,生成式建模创建前景,结合物理属性标注和动作规划,确保几何与物理一致性。
  6. GigaTrain框架:支持FP8精度、稀疏注意力和分布式训练策略,优化计算资源使用。
Card 05 数据集与资源

数据集与资源

  1. 数据集:结合公开数据集(AgiBotWorld、RoboMind)与私有数据,覆盖工业、商业、办公等14类场景,任务涵盖基础操作到长时序交互。
  2. 训练资源:使用自研GigaTrain框架,在480×768分辨率下训练61帧序列,支持多GPU/节点分布式训练与混合精度(FP8)优化。
Card 06 评估与结果

评估与结果

  1. 评估环境:在DreamGen Bench和PBench Robot Set基准测试,定量评估生成质量;真实机器人部署(如AgiBot G1)验证下游任务性能。
  2. 评估指标:物理合理性、几何一致性、文本对齐度、多视角一致性、视觉保真度;下游任务成功率与泛化能力。