返回列表
VLA / Vision-Language-Action 每日论文卡
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。

论文详情

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

2026-06-04 · 原文 · 翻译 · 2606.06491

论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。 核心目标是让单一VLA模型能够根据显式输入的速度指令,实现双向(加速和减速)的灵活速度控制,以适应机器人操作中不同风险阶段的需求。 论文指出,现有加速方法仅将策略从一个固定速度转移到另一个,忽略了减速需求,而TempoVLA通过数据增强和模型条件化实现了按需调速。

5 分钟读完 6 张阅读卡 中国人民大学 (RUC)
一眼看懂 封面预览

论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。

  • 论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。
  • 核心目标是让单一VLA模型能够根据显式输入的速度指令,实现双向(加速和减速)的灵活速度控制,以适应机器人操作中不同风险阶段的需求。
  • 论文指出,现有加速方法仅将策略从一个固定速度转移到另一个,忽略了减速需求,而TempoVLA通过数据增强和模型条件化实现了按需调速。
Card 01 研究单位

研究单位

  • 中国人民大学 (RUC)
  • 复旦大学 (FDU)
  • 北卡罗来纳大学教堂山分校 (UNC)
Card 02 论文概述

论文概述

  • 论文提出了 TempoVLA,一个速度可控的视觉-语言-动作(VLA)模型框架,旨在解决现有VLA模型执行速度固定、无法灵活控制的问题。
  • 核心目标是让单一VLA模型能够根据显式输入的速度指令,实现双向(加速和减速)的灵活速度控制,以适应机器人操作中不同风险阶段的需求。
  • 论文指出,现有加速方法仅将策略从一个固定速度转移到另一个,忽略了减速需求,而TempoVLA通过数据增强和模型条件化实现了按需调速。
Card 03 核心贡献

核心贡献

  • 提出了 可变速度轨迹增强(VSTA) 和速度条件化机制,这一轻量级数据-模型组合可为现有VLA赋予双向速度控制能力,无需采集新数据。
  • 发现经过适当重定时的数据训练后,速度控制植入简单且不依赖于特定的条件化机制,且变速训练作为有效数据增强,持续提升了模型在默认速度(1x)下的成功率。
  • 展示了该设计可扩展至视觉语言模型(VLM)驱动的动态速度调度,将执行速度转化为高层推理器的一个新控制通道。
Card 04 方法描述

方法描述

  • 数据增强(VSTA):通过在线方式,对演示数据进行运动一致性分割,然后通过合并连续动作(加速)或拆分动作(减速)来重新定时,以生成指定速度的训练数据,同时保持运动语义。
  • 模型条件化:将目标速度符作为显式条件输入模型,通过三种方案注入:文本前缀(在指令前添加速度描述)、软提示(学习速度特定的可学习令牌)或调制(多层感知机驱动RMSNorm缩放)。
  • 动态速度调度:在部署时,可与一个高层VLM(如GPT-4o)结合,由VLM观察场景并动态调度接下来数个动作块的速度,实现低风险阶段加速、高风险阶段减速的自动控制。
Card 05 数据集与资源

数据集与资源

  • 仿真数据集LIBERO 基准测试,包含4个任务套件(Spatial, Object, Goal, Long),共40个任务和500个人工遥操作演示。
  • 真实世界任务:在Franka机械臂上设计了5个任务(4个抓取放置任务和1个可变形物体任务),每个任务收集50条轨迹用于训练。
  • 基座模型:基于流匹配的VLA模型 π0.5,其视觉语言骨干为 PaliGemma
  • 训练资源:使用 32块 NVIDIA H20 GPU 训练,批次大小为512,训练迭代次数为30k。
Card 06 评估与结果

评估与结果

  • 评估基准:在LIBERO仿真环境和真实世界的Franka机械臂任务上进行评估。
  • 主要指标成功率(Success Rate)平均成功步数 以及实际执行速度与指令速度的 模型比率(Model Ratio)
  • 关键实验结果

- 速度控制可行性:VSTA能可靠地生成不同速度的演示数据,运动误差极小。

- 速度注入方案:文本前缀、调制和软提示三种方案效果相当,成功率均约96.8%,证明了方法的易植入性。

- 变速训练效果:变速训练作为数据增强,一致提升了1x速度下的成功率(仿真中从96.7%提升至96.9%以上;真实世界中从80.0%提升至88.0%),且最佳性能出现在1.25x-1.5x速度。

- 动态速度调度:在真实世界与GPT-4o调度器结合后,平均成功率达到96%,比最佳固定速度配置(88%)高出8个百分点,同时保持1.21x的平均加速。