一眼看懂
封面预览
论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。
- 论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。
- 核心目标是让单一VLA模型能够根据显式输入的速度指令,实现双向(加速和减速)的灵活速度控制,以适应机器人操作中不同风险阶段的需求。
- 论文指出,现有加速方法仅将策略从一个固定速度转移到另一个,忽略了减速需求,而TempoVLA通过数据增强和模型条件化实现了按需调速。
Card 01
研究单位
研究单位
- 中国人民大学 (RUC)
- 复旦大学 (FDU)
- 北卡罗来纳大学教堂山分校 (UNC)
Card 02
论文概述
论文概述
- 论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。
- 核心目标是让单一VLA模型能够根据显式输入的速度指令,实现双向(加速和减速)的灵活速度控制,以适应机器人操作中不同风险阶段的需求。
- 论文指出,现有加速方法仅将策略从一个固定速度转移到另一个,忽略了减速需求,而TempoVLA通过数据增强和模型条件化实现了按需调速。
Card 03
核心贡献
核心贡献
- 提出了 可变速度轨迹增强(VSTA) 和速度条件化机制,这一轻量级数据-模型组合可为现有VLA赋予双向速度控制能力,无需采集新数据。
- 发现经过适当重定时的数据训练后,速度控制植入简单且不依赖于特定的条件化机制,且变速训练作为有效数据增强,持续提升了模型在默认速度(1x)下的成功率。
- 展示了该设计可扩展至视觉语言模型(VLM)驱动的动态速度调度,将执行速度转化为高层推理器的一个新控制通道。
Card 04
方法描述
方法描述
- 数据增强(VSTA):通过在线方式,对演示数据进行运动一致性分割,然后通过合并连续动作(加速)或拆分动作(减速)来重新定时,以生成指定速度的训练数据,同时保持运动语义。
- 模型条件化:将目标速度符作为显式条件输入模型,通过三种方案注入:文本前缀(在指令前添加速度描述)、软提示(学习速度特定的可学习令牌)或调制(多层感知机驱动RMSNorm缩放)。
- 动态速度调度:在部署时,可与一个高层VLM(如GPT-4o)结合,由VLM观察场景并动态调度接下来数个动作块的速度,实现低风险阶段加速、高风险阶段减速的自动控制。
Card 05
数据集与资源
数据集与资源
- 仿真数据集:LIBERO 基准测试,包含4个任务套件(Spatial, Object, Goal, Long),共40个任务和500个人工遥操作演示。
- 真实世界任务:在Franka机械臂上设计了5个任务(4个抓取放置任务和1个可变形物体任务),每个任务收集50条轨迹用于训练。
- 基座模型:基于流匹配的VLA模型 π0.5,其视觉语言骨干为 PaliGemma。
- 训练资源:使用 32块 NVIDIA H20 GPU 训练,批次大小为512,训练迭代次数为30k。
Card 06
评估与结果
评估与结果
- 评估基准:在LIBERO仿真环境和真实世界的Franka机械臂任务上进行评估。
- 主要指标:成功率(Success Rate)、平均成功步数 以及实际执行速度与指令速度的 模型比率(Model Ratio)。
- 关键实验结果:
- 速度控制可行性:VSTA能可靠地生成不同速度的演示数据,运动误差极小。
- 速度注入方案:文本前缀、调制和软提示三种方案效果相当,成功率均约96.8%,证明了方法的易植入性。
- 变速训练效果:变速训练作为数据增强,一致提升了1x速度下的成功率(仿真中从96.7%提升至96.9%以上;真实世界中从80.0%提升至88.0%),且最佳性能出现在1.25x-1.5x速度。
- 动态速度调度:在真实世界与GPT-4o调度器结合后,平均成功率达到96%,比最佳固定速度配置(88%)高出8个百分点,同时保持1.21x的平均加速。