返回列表
VLA / Vision-Language-Action 每日论文卡
Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation
论文提出了 AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics),一种为冻结的 Vision-Language-Action (VLA) 模型添加运动感知世界模型的预测包装器。

论文详情

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

2026-06-01 · 原文 · 翻译 · 2606.02486

论文提出了 AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics),一种为冻结的 Vision-Language-Action (VLA) 模型添加运动感知世界模型的预测包装器。 该方法旨在解决 VLA 模型在动态场景(如传送带、投掷物体)中因感知到动作执行延迟而失效的问题。 核心思路是在 VLA 的特征空间中预测未来状态,使机器人能够基于预测的未来场景而非过时的当前观察进行操作。

4 分钟读完 6 张阅读卡 Carnegie Mellon University Robotics Institute, Pitt…
一眼看懂 封面预览

论文提出了 AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics),一种为冻结的 Vision-Language-Action (VLA) 模型添加运动感知世界模型的预测包装器。

  • 论文提出了 AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics),一种为冻结的 Vision-Language-Action (VLA) 模型添加运动感知世界模型的预测包装器。
  • 该方法旨在解决 VLA 模型在动态场景(如传送带、投掷物体)中因感知到动作执行延迟而失效的问题。
  • 核心思路是在 VLA 的特征空间中预测未来状态,使机器人能够基于预测的未来场景而非过时的当前观察进行操作。
Card 01 研究单位

研究单位

  • Carnegie Mellon University Robotics Institute, Pittsburgh, USA
Card 02 论文概述

论文概述

  • 论文提出了 AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics),一种为冻结的 Vision-Language-Action (VLA) 模型添加运动感知世界模型的预测包装器。
  • 该方法旨在解决 VLA 模型在动态场景(如传送带、投掷物体)中因感知到动作执行延迟而失效的问题。
  • 核心思路是在 VLA 的特征空间中预测未来状态,使机器人能够基于预测的未来场景而非过时的当前观察进行操作。
Card 03 核心贡献

核心贡献

  • 提出了一种为冻结 VLA 添加动态预测能力的包装器,无需重训练底层 VLA。
  • 实现了在空间(通过显著性选择)和时间(通过不确定性驱动的停止)轴上的自适应计算分配。
  • 引入了显式运动学条件,通过光流估计的速度和加速度在预测中进行解析传播,从恒速扩展到加速度场景。
Card 04 方法描述

方法描述

  • 使用 RAFT 光流估计每个 patch token 的速度和加速度,并结合语言注意力机制形成语言与运动显著性掩码,仅预测任务相关的动态 patch。
  • 采用条件流匹配在 VLA 的特征空间构建轻量级世界模型,利用解析运动学更新条件预测轨迹,并用不确定性估计自适应决定预测 horizon。
  • 整个模型分两阶段训练:先在操作视频语料库上预训练建立动态先验,再在少量机器人轨迹上微调弥合域差距。
Card 05 数据集与资源

数据集与资源

  • OpenVLA (7B 参数) 作为冻结的基础 VLA 模型,AHEAD 仅新增约 4.9M 参数。
  • 训练数据包括操作视频预训练语料库和约 200 条 xArm 7 机器人轨迹。
  • 训练计算资源为 4 NVIDIA RTX 4090 GPUs
Card 06 评估与结果

评估与结果

  • 评估环境包含 20 个动态仿真场景和 5 个物理 UFactory xArm 7 机器人任务(如传送带抓取、拦截投掷球)。
  • 基线方法包括 Open-loop VLARetargeting VLARealtime ACTStreaming Diffusion PolicyDreamVLA
  • 仿真结果显示,AHEAD 在所有场景达到 79%-97% 成功率,而最强基线仅达 31%-58%;物理机器人在高难度接球任务上成功率为 19/30,所有基线均失败(0/30)。