返回列表
VLA / Vision-Language-Action 每日论文卡
HOIST: Humanoid Optimization with Imitation and Sample-efficient Tuning for Manipulating Suspended Loads
论文研究 人形机器人吊装(Humanoid Hoisting) 问题,即使用人形机器人通过全身运动和非连续接触来操纵外部悬挂的、欠驱动的振荡负载。

论文详情

HOIST: Humanoid Optimization with Imitation and Sample-efficient Tuning for Manipulating Suspended Loads

2026-05-29 · 原文 · 翻译 · 2606.00252

论文研究 人形机器人吊装(Humanoid Hoisting) 问题,即使用人形机器人通过全身运动和非连续接触来操纵外部悬挂的、欠驱动的振荡负载。 提出 HOIST 方法,结合 VR 遥操作模仿学习 与 样本高效的强化学习(RL),以安全地初始化行为并优化最终放置精度和停止行为。 旨在解决纯模仿学习不直接优化最终放置精度,以及纯强化学习在真实人形机器人上不安全且样本效率低的问题。

7 分钟读完 6 张阅读卡 University of Florida,Department of Civil and Coast…
一眼看懂 封面预览

论文研究 人形机器人吊装(Humanoid Hoisting) 问题,即使用人形机器人通过全身运动和非连续接触来操纵外部悬挂的、欠驱动的振荡负载。

  • 论文研究 人形机器人吊装(Humanoid Hoisting) 问题,即使用人形机器人通过全身运动和非连续接触来操纵外部悬挂的、欠驱动的振荡负载。
  • 提出 HOIST 方法,结合 VR 遥操作模仿学习 与 样本高效的强化学习(RL),以安全地初始化行为并优化最终放置精度和停止行为。
  • 旨在解决纯模仿学习不直接优化最终放置精度,以及纯强化学习在真实人形机器人上不安全且样本效率低的问题。
Card 01 研究单位

研究单位

  • University of Florida,Department of Civil and Coastal Engineering
  • 作者包括 Songyang LiuShunyu YaoDingyuan HuangShuai Li(通讯作者)
Card 02 论文概述

论文概述

  • 论文研究 人形机器人吊装(Humanoid Hoisting) 问题,即使用人形机器人通过全身运动和非连续接触来操纵外部悬挂的、欠驱动的振荡负载。
  • 提出 HOIST 方法,结合 VR 遥操作模仿学习样本高效的强化学习(RL),以安全地初始化行为并优化最终放置精度和停止行为。
  • 旨在解决纯模仿学习不直接优化最终放置精度,以及纯强化学习在真实人形机器人上不安全且样本效率低的问题。
Card 03 核心贡献

核心贡献

  • 引入 人形机器人吊装 这一新的全身运动-操纵问题,涉及外部悬挂、间接驱动的振荡负载。
  • 提出 HOIST 框架,将 VR 遥操作、监督式 VLA(视觉-语言-动作)微调、固定全身控制器执行和样本高效的强化学习精炼相结合。
  • 在仿真和真实人形机器人上验证了 HOIST 在悬挂负载定位任务中的有效性,相比纯模仿学习,显著降低了放置误差。
  • 通过消融实验证明了 深度图像导航指令 作为输入模态对 VLA 策略初始化的重要性。
  • 分析了强化学习精炼相较于增加演示数据的优势,表明 RL 能更有效地纠正策略的部署偏差。
Card 04 方法描述

方法描述

  • 三阶段流程:首先通过 VR 遥操作 收集吊装演示数据;然后利用这些数据微调一个基于 GR00T N1.6 的高层 VLA 策略,该策略输出规划器级别的指令增量;最后,在固定 GR00T 全身控制器 执行的基础上,通过 迭代批处理强化学习(RL) 对策略进行精炼。
  • 关键技术:高层 VLA 策略预测短时域的动作指令块(action chunk),包括手部、头部、导航和基座高度目标;强化学习精炼阶段采用 离线 Actor-Critic 方法,仅更新一个 噪声引导模块,而冻结 VLA 策略本身,从而在保持安全行为的同时优化任务级奖励(放置误差)。
  • 创新点:将 VLA 策略与固定的全身控制堆栈解耦,使得任务适应完全在高层策略和 RL 精炼模块中进行,无需修改底层关节级控制。
Card 05 数据集与资源

数据集与资源

  • 演示数据:通过 PICO VR 头显和控制器 收集人类遥操作吊装演示,用于训练的策略使用 50 个(VLA-50)或 80 个(VLA-80)演示。
  • 模型基础:高层 VLA 策略基于 GR00T N1.6 模型修改,并微调了其 VLM 最后四层、扩散 Transformer 动作专家和新模态编码器。
  • 控制器:使用固定且未经过吊装任务微调的 GR00T 全身控制部署栈
  • RL 数据:强化学习精炼阶段使用了最多 30 个 由当前策略自主产生的同域 rollout。
Card 06 评估与结果

评估与结果

  • 评估环境:在 仿真真实人形机器人平台 上进行了评估。
  • 评估基准:与 VLA-50(50 个演示)、VLA-80(80 个演示)和 人类专家遥操作 的表现进行对比。
  • 主要评估指标:负载中心的 绝对平移误差(Δx, Δy, \|Δx\|+\|Δy\|)和 偏航角误差(Δψ)。
  • 关键实验结果

- RL 精炼有效性:在仿真中,HOIST(VLA-50 + 20 RL rollouts)将平移误差(\|Δx\|+\|Δy\|)从 22.44 cm 降至 2.54 cm,角度误差从 3.85° 降至 0.29°

- RL vs. 更多演示HOIST(VLA-50 + 30 RL)在仿真中平移误差为 6.25 cm,优于 VLA-80 的 18.58 cm,证明 RL 精炼比增加演示更有效。

- 真实世界验证:在真实平台上,HOIST(VLA-50 + 30 RL)实现了 6.38 cm 的平移误差,优于 VLA-50(9.28 cm)和 VLA-80(8.57 cm)。

- 消融实验:同时使用 深度图像导航指令 作为输入模态的 VLA 变体,在真实平台上取得了最佳的初始化性能(平移误差 9.28 cm,角度误差 14.5°)。