返回列表
VLA / Vision-Language-Action 每日论文卡
ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning
论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。

论文详情

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

2026-05-31 · 原文 · 翻译 · 2606.01205

论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。 提出了 ImagineUAV 框架,这是一种基于“想象”驱动的方法,通过级联的世界-动作建模,先生成未来观测视频,再提取动作,而非直接回归动作。 该方法旨在弥合高级语义推理与低级飞行动力学之间的鸿沟,实现安全、可执行的 6-DoF 飞行控制。

4 分钟读完 6 张阅读卡 Pengcheng Laboratory(作者:Xuchen Liu, Jinqiang Cui, J…
一眼看懂 封面预览

论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。

  • 论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。
  • 提出了 ImagineUAV 框架,这是一种基于“想象”驱动的方法,通过级联的世界-动作建模,先生成未来观测视频,再提取动作,而非直接回归动作。
  • 该方法旨在弥合高级语义推理与低级飞行动力学之间的鸿沟,实现安全、可执行的 6-DoF 飞行控制。
Card 01 研究单位

研究单位

  • Pengcheng Laboratory(作者:Xuchen Liu, Jinqiang Cui, Jiankun Yang)
  • Guangzhou University(作者:Jiawei Huang)
  • Southern University of Science and Technology(作者:Shihao Xia, Bingxi Liu)
Card 02 论文概述

论文概述

  • 论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。
  • 提出了 ImagineUAV 框架,这是一种基于“想象”驱动的方法,通过级联的世界-动作建模,先生成未来观测视频,再提取动作,而非直接回归动作。
  • 该方法旨在弥合高级语义推理与低级飞行动力学之间的鸿沟,实现安全、可执行的 6-DoF 飞行控制。
Card 03 核心贡献

核心贡献

  • 提出了一种指令条件的潜在视频扩散世界模型,能够根据语言指令显式“想象”未来的自我中心观测序列,实现 6-DoF 空中导航。
  • 设计了一个时空动作提取器,可从生成的视频中稳健地推断出可执行的相对运动,并结合动力学规划器生成无碰撞、动力学可行的轨迹。
  • 集成了一个带有步骤蒸馏推理流程的 UAV 导航系统,实现了低延迟的实时规划,并在 UAV-Flow 基准测试和真实飞行中验证了有效性。
Card 04 方法描述

方法描述

  • 框架包含三个紧密耦合的模块:指令条件的世界模型、几何感知的动作模块和动力学规划器。
  • 利用潜在视频扩散模型生成基于指令的未来观测序列,通过掩码相机控制训练将运动意图融入生成过程。
  • 采用基于学习的视觉里程计作为动作提取器,从生成的视频中恢复相对姿态序列,解决生成视频可能存在的时空不一致性问题。
  • 动力学规划器将提取的姿态转化为平滑、无碰撞的轨迹,确保飞行执行的安全性和可行性。
Card 05 数据集与资源

数据集与资源

  • 主要评估基准为 UAV-Flow 数据集。
  • 模型参数量为 1.3B(1.3 billion parameters)。
  • 进行了真实世界的无人机飞行测试。
Card 06 评估与结果

评估与结果

  • UAV-Flow 基准测试中,模型成功率达到 70.9%,超越了先前的 VLN 和 VLA 基线。
  • 评估指标主要包括导航成功率。
  • 实验验证了“想象”驱动的导航范式在仿真和真实环境中的实用性和优越性。