一眼看懂
封面预览
论文针对 Vision-Language-Action (VLA) 模型在长时序移动操作任务上性能不佳的问题,提出一种无需额外训练数据的解决方案
- 论文针对 Vision-Language-Action (VLA) 模型在长时序移动操作任务上性能不佳的问题,提出一种无需额外训练数据的解决方案
- 核心观点指出端到端 VLA 存在导航失败、碰撞、空间接地差、执行顺序混乱等结构性瓶颈,单纯增加数据无法解决
- 提出 MPVI (Motion Planner/VLA Interleaving) 框架,将经典运动规划与 VLA 交织集成,提升长期任务的鲁棒性
Card 01
研究单位
研究单位
- Georgia Institute of Technology (佐治亚理工学院)
Card 02
论文概述
论文概述
- 论文针对 Vision-Language-Action (VLA) 模型在长时序移动操作任务上性能不佳的问题,提出一种无需额外训练数据的解决方案
- 核心观点指出端到端 VLA 存在导航失败、碰撞、空间接地差、执行顺序混乱等结构性瓶颈,单纯增加数据无法解决
- 提出 MPVI (Motion Planner/VLA Interleaving) 框架,将经典运动规划与 VLA 交织集成,提升长期任务的鲁棒性
Card 03
核心贡献
核心贡献
- 提出 MPVI 框架,首次将运动规划器作为 VLA 的引导机制,解决长期移动操作中的导航失败和执行顺序混乱问题
- 设计基于 本体感觉触发 的子任务转换机制,避免仅依赖 VLM 视觉推理导致的幻觉和级联失败
- 在 BEHAVIOR-1K 基准测试上实现 113% 的任务进度提升,超越顶尖端到端 VLA 基线
- 提出模块化集成方案,包括子任务规划、编排器、运动规划导航和 VLM 完成检查等五大组件
Card 04
方法描述
方法描述
- 使用 LLM 将自然语言指令分解为标记为导航或操作的短子任务,并生成状态基的完成标准
- 编排器 根据子任务类型将控制权路由至运动规划器(导航)或 VLA(操作),并维护物体位置知识库
- 导航模块 采用 A\* 运动规划、GroundingDINO 开放词汇检测和 前沿探索 处理未知物体位置
- 操作模块 使用 openpi-comet VLA 执行精细操作,仅在到达目标附近后切换控制权
- 完成检查器 使用 Gemini 2.5 Flash VLM,仅在夹爪或手臂状态表明操作原语完成时触发查询,避免周期性查询的幻觉风险
Card 05
数据集与资源
数据集与资源
- 评估数据集:BEHAVIOR-1K 基准测试的 50 个任务集(每个任务 10 个实例),在 OmniGibson 高保真模拟器中运行
- 基线模型:openpi-comet(基于 $\pi_{0.5}$ VLA,在 2025 年 BEHAVIOR 挑战赛中获第二名)
- 硬件资源:24 核 Intel Xeon Gold 6226 CPU、128 GB RAM、两块 NVIDIA Quadro RTX6000 GPU (48 GB VRAM)
Card 06
评估与结果
评估与结果
- 评估指标:Q-score(目标 BDDL 谓词满足比例)、归一化模拟时间、基座距离、末端执行器距离
- 关键结果:MPVI 在所有 50 个任务上平均 Q-score 比端到端 VLA 基线提升 113%(31 个任务改进,16 个持平,3 个退化)
- 效率对比:在相同 Q-score 的匹配测试中,MPVI 的基座行程减少 4.5%,模拟时间减少 9.8%,末端执行器位移减少 13%
- 消融实验证明:移除本体感觉触发会导致性能下降 47%;仅用子任务预测比 MPVI 低 31% 但仍优于基线 41%;真实物体定位比 MPVI 提升 17%