一眼看懂
封面预览
提出 WorldFly,一个基于世界模型的视觉-语言-动作(VLA)框架,用于无人机在复杂城市环境中的导航。
- 提出 WorldFly,一个基于世界模型的视觉-语言-动作(VLA)框架,用于无人机在复杂城市环境中的导航。
- 针对现有VLA模型在严重遮挡和剧烈视角变化下缺乏空间想象力的“短视”问题,通过联合生成未来视频预测和导航动作来提升决策鲁棒性。
- 构建了具有挑战性的 Urban Canyon Traversal 基准测试,专门评估模型在剧烈视角变化和长距离导航中的指令遵循能力。
Card 01
研究单位
研究单位
- 清华大学深圳国际研究生院 (Tsinghua Shenzhen International Graduate School)
- 清华大学 BNRist (BNRist, Tsinghua University)
Card 02
论文概述
论文概述
- 提出 WorldFly,一个基于世界模型的视觉-语言-动作(VLA)框架,用于无人机在复杂城市环境中的导航。
- 针对现有VLA模型在严重遮挡和剧烈视角变化下缺乏空间想象力的“短视”问题,通过联合生成未来视频预测和导航动作来提升决策鲁棒性。
- 构建了具有挑战性的 Urban Canyon Traversal 基准测试,专门评估模型在剧烈视角变化和长距离导航中的指令遵循能力。
Card 03
核心贡献
核心贡献
- 构建了 Urban Canyon Traversal 基准测试,用于评估VLA模型在城市峡谷环境中处理严重遮挡和剧烈视角变化的能力。
- 提出了 WorldFly 框架,首次将世界模型集成到无人机VLA任务中,通过 双分支耦合架构 联合优化未来场景想象与动作生成。
- 在 Urban Canyon Traversal 基准测试上,WorldFly 的性能显著优于现有基线模型,特别是在未见过的环境中,验证了世界模型对具身空中智能体的有效性。
Card 04
方法描述
方法描述
- 采用 双分支耦合架构,将模型显式解耦为世界模型分支和动作专家分支,并保持独立参数。
- 利用 流匹配 机制,在共享时间步长下为两个分支添加噪声,确保动态与动作之间的时间一致性。
- 通过周期性插入的 双分支耦合块 实现跨模态信息交换,让动作策略利用想象的未来动态,同时世界模型生成受规划轨迹约束。
- 使用 T5 编码语言指令,LTX-Video VAE 将视频帧编码到压缩潜在空间以进行高效建模。
Card 05
数据集与资源
数据集与资源
- 使用自建的 Urban Canyon Traversal 基准测试,包含超过4000条导航轨迹,分为 TEST-EASY (100 条) 和 TEST-HARD (100 条) 两个评估集。
- WorldFly 模型参数量未明确,但世界模型分支隐藏维度为 2048,动作专家分支隐藏维度为 512,共 28 层。
- 训练资源:使用 4 块 NVIDIA A100 GPU 训练 40,000 步,全局批大小为 128。
Card 06
评估与结果
评估与结果
- 评估环境:基于 AirSim 仿真平台的 Urban Canyon Traversal 基准测试。
- 主要评估指标:成功率 (SR)、导航误差 (NE)、路径长度加权成功率 (SPL)。
- 在 TEST-EASY 上,WorldFly 达到 87% 的成功率和 7.92m 的导航误差,显著优于 OpenFly (72%, 14.69m)。
- 在 TEST-HARD(未见环境)上,WorldFly 成功率为 31%,导航误差为 31.08m,约为 OpenFly 成功率 (16%) 的近两倍,展现了更强的泛化能力。
- 消融实验表明,移除 双分支耦合块 会导致性能显著下降,特别是在 TEST-HARD 上成功率从 31% 降至 21%,验证了该架构的关键作用。