一眼看懂
封面预览
该论文探讨了在视觉-语言-动作(VLA)模型中,何种形式的中间推理最适合连续控制任务。
- 该论文探讨了在视觉-语言-动作(VLA)模型中,何种形式的中间推理最适合连续控制任务。
- 论文提出,VLA模型的“语言”应是一个连续内部接口,并需具备可重用性、可共享性和抽象对齐三个特性,以解决现有文本推理、潜在规划等方法在控制粒度、可验证性上的不足。
- 论文旨在通过构建一个连续推理框架,让 VLA 模型生成的推理痕迹能够被其他模型实例复用,并有效指导动作生成,从而提升机器人在面对分布外场景时的鲁棒性。
Card 01
研究单位
研究单位
- 论文作者所属机构未在提供的 HTML 片段中明确列出,但通过通讯作者邮箱(kris.wu@airoa.org)可推断其隶属于 AIROA 组织。
Card 02
论文概述
论文概述
- 该论文探讨了在视觉-语言-动作(VLA)模型中,何种形式的中间推理最适合连续控制任务。
- 论文提出,VLA模型的“语言”应是一个连续内部接口,并需具备可重用性、可共享性和抽象对齐三个特性,以解决现有文本推理、潜在规划等方法在控制粒度、可验证性上的不足。
- 论文旨在通过构建一个连续推理框架,让 VLA 模型生成的推理痕迹能够被其他模型实例复用,并有效指导动作生成,从而提升机器人在面对分布外场景时的鲁棒性。
Card 03
核心贡献
核心贡献
- 形式化了 连续推理作为 VLA 模型的一个独特接口,并明确其定义、可重用性、可共享性和抽象对齐三大属性。
- 实例化了该框架,包含一个WAE 结构化的高斯潜在接口、一个自验证目标以及块对齐的动作生成机制。
- 通过实验证明,该方法在仿真基准 LIBERO-PRO 和真实机器人平台(TX-G2 和 HSR)上均取得了显著的性能提升,特别是在需要空间重锚定和任务级适应的场景中表现突出。
Card 04
方法描述
方法描述
- 核心思想是将连续推理实例化为一个共享的内部接口,该接口连接感知语言上下文和未来动作生成。
- 结构化思路生成:模型首先生成一组原始思想向量,并通过Wasserstein自编码器将它们映射到共享的高斯潜在空间,形成一个可共享的几何结构。
- 自验证与可重用推理:引入一个指数移动平均教师模型,该模型必须成功解码并利用学生模型生成的共享潜在代码来预测动作,以此验证生成思路的可重用性。
- 流匹配动作预测:采用流匹配目标进行动作预测,并使用块因果注意力掩码,使得动作预测在块级别上进行,与高层控制推理的抽象粒度对齐。
Card 05
数据集与资源
数据集与资源
- 仿真数据集:主要使用 LIBERO-PRO 基准测试,该基准包含多个扰动家族(对象、位置、语义、任务),用于评估策略的鲁棒性。
- 真实机器人数据集:在 TX-G2(双臂平台)和 HSR(移动机器人平台)上收集了多任务操作数据集,包括餐具转移、碗堆叠、衣物分类等任务。
- 模型架构:基于 π0.5 模型框架构建,具体参数规模未在文中明确提及,但骨架为流匹配动作生成模型。
- 训练资源:论文提到在真实机器人评估中,由于 RTX 5070 评估设置的内存限制,排除了 OpenVLA-OFT 基线,暗示其训练和推理在消费级或类似算力的 GPU 上进行。
Card 06
评估与结果
评估与结果
- 评估环境:仿真环境为 LIBERO-PRO,评估四个扰动类型下的成功率;真实环境为 TX-G2 和 HSR 机器人,评估子任务成功率。
- 主要评估指标:仿真采用不同扰动类型下的任务成功率;真实机器人采用平均子任务成功率。
- 关键实验结果:
- 在 LIBERO-PRO 上,连续推理的整体鲁棒性最佳,平均套件得分从基线的 58.0 提升至 64.0,特别是在位置和任务扰动上提升显著。
- 真实机器人实验中,与 π0.5 基线相比,连续推理在 TX-G2 上的平均子任务成功率提升了 40.4%,在 HSR 上提升了 26.3%,展示了其在真实世界任务中的强大泛化能力。
- 消融实验表明,移除高斯潜在结构化、块因果掩码、显式连续思想或自验证机制中的任何一个,都会导致性能下降,其中移除高斯潜在结构化导致的性能衰减最为严重。