一眼看懂
封面预览
提出了一个完全开源的具身智能软硬件统一平台 OpenEAI-Platform,整合了低成本机械臂 OpenEAI-Arm 和可复现的视觉-语言-动作(VLA)模型 OpenEAI-VLA
- 提出了一个完全开源的具身智能软硬件统一平台 OpenEAI-Platform,整合了低成本机械臂 OpenEAI-Arm 和可复现的视觉-语言-动作(VLA)模型 OpenEAI-VLA
- 旨在解决真实世界具身智能中的可复现性和数据扩展瓶颈,打破商业机械臂成本高昂和先进VLA模型依赖私有数据的限制
- 提供完整的硬件设计、驱动、模型和训练/数据流程,以支持可复现的研究和大规模数据收集
Card 01
研究单位
研究单位
- Shanghai Innovation Institute
- Huazhong University of Science and Technology
- Shanghai Jiao Tong University
Card 02
论文概述
论文概述
- 提出了一个完全开源的具身智能软硬件统一平台 OpenEAI-Platform,整合了低成本机械臂 OpenEAI-Arm 和可复现的视觉-语言-动作(VLA)模型 OpenEAI-VLA
- 旨在解决真实世界具身智能中的可复现性和数据扩展瓶颈,打破商业机械臂成本高昂和先进VLA模型依赖私有数据的限制
- 提供完整的硬件设计、驱动、模型和训练/数据流程,以支持可复现的研究和大规模数据收集
Card 03
核心贡献
核心贡献
- 提出了一个低成本、具备有效控制算法的 6+1自由度 机械臂 OpenEAI-Arm,并公开完整的制造材料以支持复制和规模化生产
- 提出了一个两阶段、完全可复现的数据和训练方案,包含数据集转换与清洗流程、开源预训练数据集混合方案以及结合多模态数据的微调协议
- 提出了一个开源的 VLA 策略 OpenEAI-VLA,结合了预训练的 Qwen3-VL 作为主干网络和生成式动作头,可通过发布代码库从零开始训练和部署
- 在多个真实世界操作任务上对完整系统进行了全面的实验验证,证明了仅依赖开源数据和代码即可达到媲美大规模预训练 SOTA VLA 基线和商业机器人平台的成功率
Card 04
方法描述
方法描述
- OpenEAI-VLA 采用 Qwen3-VL-4B 作为主干网络,引入固定长度的可学习特征查询机制作为多模态感知与动作生成的接口,以压缩视觉和指令特征
- 动作专家采用 18 层 Diffusion Transformer 架构,通过条件流匹配生成连续的动作块
- OpenEAI-Arm 采用类似人臂的 6自由度串行构型,通过 NSGA-III 算法优化 MDH 参数以平衡操作可操作性和持久效率
- 控制设计采用基于动力学前馈补偿的 FF-PID 控制器,并结合三点滚动贝塞尔曲线插值和 S 曲线轮廓,以确保平滑的速度和加速度过渡
Card 05
数据集与资源
数据集与资源
- 预训练数据集:Open X-Embodiment 子集的加权混合
- 微调数据集:小规模的域内人类演示数据结合多模态数据集(COCO、VQA-v2、PixMo-Points)
- 模型规模:主干网络为 Qwen3-VL-4B,动作专家为 18层 DiT
- 硬件成本:OpenEAI-Arm 总制造成本约为 790 USD
Card 06
评估与结果
评估与结果
- 评估环境:四个真实世界操作任务(Clean Table、Make Tea、Fold Towel、Fold T-shirt)
- 硬件对比基准:ARX R5、AgileX Piper;模型对比基准:ACT、Octo、OpenVLA-oft、$\pi_0$、$\pi_{0.5}$
- 硬件结果:在相同的 $\pi_0$ 策略下,OpenEAI-Arm 的平均成功率为 0.75,优于 ARX R5 (0.71) 和 Piper (0.64)
- 模型结果:OpenEAI-VLA 仅使用开源数据,在 Fold T-shirt 任务上达到与 $\pi_{0.5}$ 相同的最佳成功率 0.83,整体性能与大规模预训练的 $\pi_0$ 和 $\pi_{0.5}$ 相当