一眼看懂
封面预览
暂无内容
- 暂无内容
- 系统研究了VLA中动作块horizon的影响,揭示了长期预测与短期精度之间的关键权衡。
- 提出了混合视界策略,这是一个即插即用、低开销的方法,缓解了上述权衡,提升了性能和泛化能力。
Card 01
论文概述
论文概述
- 暂无内容
Card 02
研究单位
研究单位
中国人民大学 (RUC), 北卡罗来纳大学教堂山分校 (UNC), 香港中文大学 (CUHK)
Card 03
论文概述
论文概述
该论文研究了视觉-语言-动作(VLA)模型中动作块长度(horizon)的影响。研究发现存在一个固有的权衡:较长的horizon提供更好的全局规划能力但会降低细粒度精度,而较短的horizon提供精确的局部控制但在长期任务上表现不佳。为解决这一问题,论文提出了混合视界策略,通过将动作块重组为不同长度的分段,使用共享的动作变换器并行处理,并通过轻量级线性门控融合输出。
Card 04
核心贡献
核心贡献
- 系统研究了VLA中动作块horizon的影响,揭示了长期预测与短期精度之间的关键权衡。
- 提出了混合视界策略,这是一个即插即用、低开销的方法,缓解了上述权衡,提升了性能和泛化能力。
- 提出了通过跨horizon共识的动态推理方案,以实现更稳定、更快的执行。
Card 05
方法描述
方法描述
混合视界策略包含以下关键组件:
- 动作块重排:将最大horizon H的动作块按候选集合 H={h1, ..., hN} 截断为多个子块。
- 共享处理:使用单一动作变换器并行处理所有horizon的子块,通过特定注意力掩码处理不同长度。
- 门控融合:添加轻量级线性门控头,为每个时间步和horizon生成权重,通过softmax归一化后加权融合各horizon预测。
- 平衡损失:引入负载平衡损失,鼓励所有horizon被均衡利用,避免门控网络退化。
- 动态推理:通过跨horizon共识机制,选择稳定的动作前缀执行,将不确定动作推迟到下次重规划,提高吞吐量。
Card 06
数据集与资源
数据集与资源
- 数据集:LIBERO(包含Spatial、Object、Goal、Long四个任务套件)和RoboTwin 2.0(包含50个双手机器人任务)。
- 训练资源:4块NVIDIA A100 GPU,训练30k迭代,批量大小32,LIBERO训练在10小时内完成,RoboTwin训练约3k-10k迭代。
- 基础模型:基于PaliGemma的π系列模型(π0、π0.5、πreg)。
Card 07
评估与结果
评估与结果
- 评估环境:LIBERO仿真环境(评估500次试验)和RoboTwin 2.0仿真环境(简单和困难模式各评估100次试验)。
- 评估指标:任务成功率,LIBERO执行每个动作块的前5步,RoboTwin执行前20步。
- 比较方法:包括Octo、OpenVLA、Diffusion Policy等SOTA方法,在相同随机种子下进行公平比较。