返回列表
VLA / Vision-Language-Action 每日论文卡
Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation
提出 GTP-FA(Grasp-Then-Plan with Failure Attribution),一个面向任务的两阶段“先抓取后规划”闭环框架,解决长时序机器人操作中抓取与下游规划/控制策略耦合导致的失败归因不清问题

论文详情

Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation

2026-06-02 · 原文 · 翻译 · 2606.03385

提出 GTP-FA(Grasp-Then-Plan with Failure Attribution),一个面向任务的两阶段“先抓取后规划”闭环框架,解决长时序机器人操作中抓取与下游规划/控制策略耦合导致的失败归因不清问题 通过学习失败归因模型,将执行失败分解为 抓取功能性不匹配(FM-G1)、抓取不稳定(FM-G2) 和 下游规划/控制不足(FM-P) 三类,并据此指导抓取与规划模块的定向优化 在仿真和真实机器人上验证,框架可适配 RL、IL、扩散策略、VLA 等多种基学习器,普遍提升任务成功率

6 分钟读完 6 张阅读卡 作者均来自 东南大学计算机科学与工程学院(School of Computer Science and…
一眼看懂 封面预览

提出 GTP-FA(Grasp-Then-Plan with Failure Attribution),一个面向任务的两阶段“先抓取后规划”闭环框架,解决长时序机器人操作中抓取与下游规划/控制策略耦合导致的失败归因不清问题

  • 提出 GTP-FA(Grasp-Then-Plan with Failure Attribution),一个面向任务的两阶段“先抓取后规划”闭环框架,解决长时序机器人操作中抓取与下游规划/控制策略耦合导致的失败归因不清问题
  • 通过学习失败归因模型,将执行失败分解为 抓取功能性不匹配(FM-G1)、抓取不稳定(FM-G2) 和 下游规划/控制不足(FM-P) 三类,并据此指导抓取与规划模块的定向优化
  • 在仿真和真实机器人上验证,框架可适配 RL、IL、扩散策略、VLA 等多种基学习器,普遍提升任务成功率
Card 01 研究单位

研究单位

  • 作者均来自 东南大学计算机科学与工程学院(School of Computer Science and Engineering, Southeast University, China)
Card 02 论文概述

论文概述

  • 提出 GTP-FA(Grasp-Then-Plan with Failure Attribution),一个面向任务的两阶段“先抓取后规划”闭环框架,解决长时序机器人操作中抓取与下游规划/控制策略耦合导致的失败归因不清问题
  • 通过学习失败归因模型,将执行失败分解为 抓取功能性不匹配(FM-G1)抓取不稳定(FM-G2)下游规划/控制不足(FM-P) 三类,并据此指导抓取与规划模块的定向优化
  • 在仿真和真实机器人上验证,框架可适配 RL、IL、扩散策略、VLA 等多种基学习器,普遍提升任务成功率
Card 03 核心贡献

核心贡献

  • 引入面向任务的 Grasp-Then-Plan 闭环框架,显式地将抓取选择与下游任务成功绑定,避免抓取与规划耦合导致的训练污染
  • 设计 失败归因判别器 并结合 抓取条件诊断表示空间,实现对未见抓取的稳定归因,区分抓取侧与规划侧失败
  • 提出 诊断驱动的双向优化策略:对抓取侧注入任务先验和风险惩罚,对规划侧通过硬样本挖掘、分布重塑和责任加权学习进行针对性提升
  • 提供一种 基学习器无关的接口,可无缝集成到 PPO、SAC、BC、扩散策略、VLA 等多种策略学习框架中
Card 04 方法描述

方法描述

  • 失败归因:利用受控重复试验构造弱监督伪标签,训练失败归因判别器 \(D\) 输出失败模式分布;同时训练抓取条件诊断嵌入 \(E\),通过局部一致性先验和近邻投票获得邻域诊断先验,并与 \(D\) 融合得到稳定归因信号
  • 抓取侧优化:基于归因结果,训练风险预测器估计抓取不稳定风险,结合 VLM 导出的粗粒度任务先验约束,在抓取评分中增加任务兼容性奖励和稳定性惩罚,筛选高可行性抓取
  • 规划侧优化:提取规划主导的硬样本集 \(\mathcal{G}_{\mathrm{hardP}}\),通过训练分布重塑和样本重采样增强对规划瓶颈的覆盖;同时用归因得到的规划责任权重 \(w_P\) 对下游训练损失进行重加权,避免抓取错误污染策略学习
  • 闭环流程:执行 → 诊断 → 更新,持续迭代优化抓取和规划两端
Card 05 数据集与资源

数据集与资源

  • 仿真环境ManiSkill3 中的 8 个长时序操作任务:StackCube、PokeCube、LiftPegUpright、PlaceSphere、PickCube、PushCube、PullCube、PullCubeTool
  • 真实机器人Franka Research 3 平台,配备 Robotiq 夹爪和基座/腕部 D435i 相机
  • 基学习器PPOSACBC扩散策略 (DP)VLA 模型 \(\pi_{0.5}\)(LoRA 微调,仿真用 100 条专家轨迹,真实用 300 条)
  • 训练资源:PPO/SAC/BC/DP 使用 2×RTX 4090 GPU;VLA 微调使用 3×A100 GPU;实机推理使用 RTX 4090 工作站
Card 06 评估与结果

评估与结果

  • 评估指标:仿真采用 success_once(任意时刻成功)和 success_at_end(结束时成功),真实机器人采用任务成功率
  • 仿真结果:GTP-FA 在所有基学习器上均显著提升,例如 PPO 在 8 个任务的平均 success_at_end 从 41.8% 提升至 73.3%,相对提升 +31.3 个百分点;BC 和 DP 同样大幅提升
  • 消融实验:仅优化单侧(01/10)或简单联合优化(11)均导致性能下降或训练不稳定,证明诊断驱动双向优化的重要性
  • 真实机器人实验:在堆叠、抓取、工具使用等任务上验证了有效性,GTP-FA 相比原始策略能选择更合适的抓取姿态并提高执行成功率
  • 失败归因稳定性:通过 D/E 融合,在未见抓取上保持归因准确,避免优化压力错误分配