一眼看懂
封面预览
本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。
- 本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。
- 提出GigaWorld-0作为数据引擎,整合视频生成与3D物理仿真,解决具身AI的数据瓶颈问题。
- 设计GigaWorld-0-Video系列模型,支持文本控制的外观、视角和动作迁移,以及多视角生成。
Card 01
研究单位
研究单位
GigaAI
Card 02
论文概述
论文概述
本文介绍了GigaWorld-0,一个统一的世界模型框架,旨在作为视觉-语言-动作(VLA)学习的数据引擎。它整合了两个协同组件:用于生成大规模视频的GigaWorld-0-Video和结合3D生成建模、物理仿真与运动规划的GigaWorld-0-3D,共同生成视觉丰富、几何一致且物理合理的具身交互数据。通过高效的GigaTrain训练框架实现大规模训练,实验证明其生成数据能显著提升VLA模型在真实机器人任务中的泛化能力和成功率。
Card 03
核心贡献
核心贡献
- 提出GigaWorld-0作为数据引擎,整合视频生成与3D物理仿真,解决具身AI的数据瓶颈问题。
- 设计GigaWorld-0-Video系列模型,支持文本控制的外观、视角和动作迁移,以及多视角生成。
- 开发GigaWorld-0-3D模块,实现几何一致的3D场景重建、物理属性标注和可执行动作规划。
- 构建GigaTrain训练框架,利用FP8精度和稀疏注意力优化大规模视频生成效率。
- 通过下游任务验证,证明生成数据能提升VLA模型在真实机器人任务中的性能。
Card 04
方法描述
方法描述
- GigaWorld-0-Video-Dreamer:基于流匹配和MoE架构的视频基础模型,支持图像-文本到视频生成。
- GigaWorld-0-Video-AppearanceTransfer:通过轻量控制分支实现文本引导的纹理、材质和光照编辑。
- GigaWorld-0-Video-ViewTransfer:结合双条件控制,生成新视角视频并同步调整机器人动作。
- GigaWorld-0-Video-MimicTransfer:将第一人称人类操作视频转换为机器人可执行轨迹。
- GigaWorld-0-3D:通过3D高斯溅射重建背景,生成式建模创建前景,结合物理属性标注和动作规划,确保几何与物理一致性。
- GigaTrain框架:支持FP8精度、稀疏注意力和分布式训练策略,优化计算资源使用。
Card 05
数据集与资源
数据集与资源
- 数据集:结合公开数据集(AgiBotWorld、RoboMind)与私有数据,覆盖工业、商业、办公等14类场景,任务涵盖基础操作到长时序交互。
- 训练资源:使用自研GigaTrain框架,在480×768分辨率下训练61帧序列,支持多GPU/节点分布式训练与混合精度(FP8)优化。
Card 06
评估与结果
评估与结果
- 评估环境:在DreamGen Bench和PBench Robot Set基准测试,定量评估生成质量;真实机器人部署(如AgiBot G1)验证下游任务性能。
- 评估指标:物理合理性、几何一致性、文本对齐度、多视角一致性、视觉保真度;下游任务成功率与泛化能力。