返回列表
VLA / Vision-Language-Action 每日论文卡
Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO
论文提出针对无人机(UAV)3D空中导航的强化学习框架,旨在解决传统监督微调(SFT)在处理复杂、细粒度人类意图指令时存在的数据稀缺、泛化能力弱和监督不足的问题

论文详情

Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO

2026-06-01 · 原文 · 翻译 · 2606.02313

论文提出针对无人机(UAV)3D空中导航的强化学习框架,旨在解决传统监督微调(SFT)在处理复杂、细粒度人类意图指令时存在的数据稀缺、泛化能力弱和监督不足的问题 核心目标是使视觉-语言-动作(VLA)模型不仅能到达目标,还能精确对齐人类意图,实现“如何飞行”而非仅“飞向何处” 论文通过设计专家引导的强化学习算法与高效训练系统,提升无人机在语义指令下的导航质量与意图执行能力

5 分钟读完 6 张阅读卡 浙江大学
一眼看懂 封面预览

论文提出针对无人机(UAV)3D空中导航的强化学习框架,旨在解决传统监督微调(SFT)在处理复杂、细粒度人类意图指令时存在的数据稀缺、泛化能力弱和监督不足的问题

  • 论文提出针对无人机(UAV)3D空中导航的强化学习框架,旨在解决传统监督微调(SFT)在处理复杂、细粒度人类意图指令时存在的数据稀缺、泛化能力弱和监督不足的问题
  • 核心目标是使视觉-语言-动作(VLA)模型不仅能到达目标,还能精确对齐人类意图,实现“如何飞行”而非仅“飞向何处”
  • 论文通过设计专家引导的强化学习算法与高效训练系统,提升无人机在语义指令下的导航质量与意图执行能力
Card 01 研究单位

研究单位

  • 浙江大学
  • Differential Robotics
Card 02 论文概述

论文概述

  • 论文提出针对无人机(UAV)3D空中导航的强化学习框架,旨在解决传统监督微调(SFT)在处理复杂、细粒度人类意图指令时存在的数据稀缺、泛化能力弱和监督不足的问题
  • 核心目标是使视觉-语言-动作(VLA)模型不仅能到达目标,还能精确对齐人类意图,实现“如何飞行”而非仅“飞向何处”
  • 论文通过设计专家引导的强化学习算法与高效训练系统,提升无人机在语义指令下的导航质量与意图执行能力
Card 03 核心贡献

核心贡献

  • 提出 EG-GRPO(Expert-Guided Group Relative Policy Optimization)算法,将少样本专家轨迹注入在线训练,解决大连续空间中高效探索与稀疏奖励下的策略停滞问题
  • 设计异构并行化管道,实现仿真与推理的异步流水线执行,将训练中 rollout 阶段时间减少 43.5%
  • 构建基于 Isaac Lab 的高保真、可交互无人机仿真平台,支持大规模并行轨迹采样与在线数据获取
  • 引入指令条件奖励模型,利用大语言模型(LLM)提供细粒度轨迹级反馈,指导策略优化
Card 04 方法描述

方法描述

  • 基于 OpenVLA-OFT 模型,通过动作掩码将其输出约束为4自由度姿态控制命令,并在 UAV-flow 数据集上进行监督微调以获得初始导航策略
  • 在强化微调阶段,采用 EG-GRPO 算法:在每次策略迭代中,从混合分布(在线轨迹 + 专家轨迹)中采样轨迹组,通过组相对优势计算保留非退化梯度信号,防止奖励稀疏下的探索崩溃
  • 使用指令条件奖励模型对完整飞行轨迹进行评分,提供优化信号;该奖励模型通过人类无人机飞行员评估验证,与专家判断高度一致
  • 通过双缓冲机制与SSH/Ray分布式框架,实现仿真(RT Core GPU如L20)与推理(计算GPU如A100)的异步并行,提升硬件利用率
Card 05 数据集与资源

数据集与资源

  • 使用 UAV-flow 数据集进行监督微调阶段的训练
  • 基础模型为 OpenVLA-OFT(VLA模型)
  • 训练资源涉及异构GPU组合:用于仿真与光线追踪的 NVIDIA L20 GPU,用于模型推理的 NVIDIA A100 GPU
Card 06 评估与结果

评估与结果

  • 在自建的 Human-Intent-Driven Navigation 评估套件上进行测试,包含简单任务(常见导航指令)与困难任务(复杂飞行技能)
  • 主要评估指标为 成功率(SR)意图对齐分数(IAS),后者由指令条件奖励模型生成并验证
  • 核心结果:EG-GRPO 将整体成功率从SFT基线的 26.1% 提升至 55.6%(提升幅度 2.13×),意图对齐分数提升 60.9%
  • 在困难任务上,相比无专家数据的GRPO,专家数据注入带来额外IAS提升 1.54 和SR提升 16.7%
  • 真实世界部署实现零样本迁移,成功执行S形绕行、速度调节物体导航、视觉锁定环绕等任务