一眼看懂
封面预览
论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。
- 论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。
- 提出了 ImagineUAV 框架,这是一种基于“想象”驱动的方法,通过级联的世界-动作建模,先生成未来观测视频,再提取动作,而非直接回归动作。
- 该方法旨在弥合高级语义推理与低级飞行动力学之间的鸿沟,实现安全、可执行的 6-DoF 飞行控制。
Card 01
研究单位
研究单位
- Pengcheng Laboratory(作者:Xuchen Liu, Jinqiang Cui, Jiankun Yang)
- Guangzhou University(作者:Jiawei Huang)
- Southern University of Science and Technology(作者:Shihao Xia, Bingxi Liu)
Card 02
论文概述
论文概述
- 论文针对无人机(UAV)在部分可观测环境下执行自然语言指令时的视觉语言导航(VLN)任务,解决了现有视觉-语言-动作(VLA)模型在几何一致性和动力学匹配方面的脆弱性问题。
- 提出了 ImagineUAV 框架,这是一种基于“想象”驱动的方法,通过级联的世界-动作建模,先生成未来观测视频,再提取动作,而非直接回归动作。
- 该方法旨在弥合高级语义推理与低级飞行动力学之间的鸿沟,实现安全、可执行的 6-DoF 飞行控制。
Card 03
核心贡献
核心贡献
- 提出了一种指令条件的潜在视频扩散世界模型,能够根据语言指令显式“想象”未来的自我中心观测序列,实现 6-DoF 空中导航。
- 设计了一个时空动作提取器,可从生成的视频中稳健地推断出可执行的相对运动,并结合动力学规划器生成无碰撞、动力学可行的轨迹。
- 集成了一个带有步骤蒸馏推理流程的 UAV 导航系统,实现了低延迟的实时规划,并在 UAV-Flow 基准测试和真实飞行中验证了有效性。
Card 04
方法描述
方法描述
- 框架包含三个紧密耦合的模块:指令条件的世界模型、几何感知的动作模块和动力学规划器。
- 利用潜在视频扩散模型生成基于指令的未来观测序列,通过掩码相机控制训练将运动意图融入生成过程。
- 采用基于学习的视觉里程计作为动作提取器,从生成的视频中恢复相对姿态序列,解决生成视频可能存在的时空不一致性问题。
- 动力学规划器将提取的姿态转化为平滑、无碰撞的轨迹,确保飞行执行的安全性和可行性。
Card 05
数据集与资源
数据集与资源
- 主要评估基准为 UAV-Flow 数据集。
- 模型参数量为 1.3B(1.3 billion parameters)。
- 进行了真实世界的无人机飞行测试。
Card 06
评估与结果
评估与结果
- 在 UAV-Flow 基准测试中,模型成功率达到 70.9%,超越了先前的 VLN 和 VLA 基线。
- 评估指标主要包括导航成功率。
- 实验验证了“想象”驱动的导航范式在仿真和真实环境中的实用性和优越性。