返回列表
VLA / Vision-Language-Action 每日论文卡
ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement
提出了一种名为 ROG-Grasp 的几何驱动型机器人抓取与放置框架,旨在实现农产品(如番茄、洋葱)的定向抓取与直立放置。

论文详情

ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement

2026-05-30 · 原文 · 翻译 · 2606.00449

提出了一种名为 ROG-Grasp 的几何驱动型机器人抓取与放置框架,旨在实现农产品(如番茄、洋葱)的定向抓取与直立放置。 利用 RGB-D 感知与农产品根表面的近似平面几何特性,通过根区域检测与点云拟合推断物体方向,生成稳定的抓取姿态。 解决了现有农业机器人系统主要关注抓取而忽略放置方向控制,以及端到端 VLA 模型难以准确识别根区域、无法满足精准定向操作需求的难题。

4 分钟读完 6 张阅读卡 Drexel University 电子与计算机工程系
一眼看懂 封面预览

提出了一种名为 ROG-Grasp 的几何驱动型机器人抓取与放置框架,旨在实现农产品(如番茄、洋葱)的定向抓取与直立放置。

  • 提出了一种名为 ROG-Grasp 的几何驱动型机器人抓取与放置框架,旨在实现农产品(如番茄、洋葱)的定向抓取与直立放置。
  • 利用 RGB-D 感知与农产品根表面的近似平面几何特性,通过根区域检测与点云拟合推断物体方向,生成稳定的抓取姿态。
  • 解决了现有农业机器人系统主要关注抓取而忽略放置方向控制,以及端到端 VLA 模型难以准确识别根区域、无法满足精准定向操作需求的难题。
Card 01 研究单位

研究单位

  • Drexel University 电子与计算机工程系
  • Virginia Tech 农业研究推广中心及生物系统工程系
  • Amazon Store Foundation AI (SFAI)
Card 02 论文概述

论文概述

  • 提出了一种名为 ROG-Grasp 的几何驱动型机器人抓取与放置框架,旨在实现农产品(如番茄、洋葱)的定向抓取与直立放置。
  • 利用 RGB-D 感知与农产品根表面的近似平面几何特性,通过根区域检测与点云拟合推断物体方向,生成稳定的抓取姿态。
  • 解决了现有农业机器人系统主要关注抓取而忽略放置方向控制,以及端到端 VLA 模型难以准确识别根区域、无法满足精准定向操作需求的难题。
Card 03 核心贡献

核心贡献

  • 提出一种基于根表面几何的农产品方向估计方法,利用 RGB-D 观测数据实现定向抓取。
  • 设计了一种融合 YOLO 根区域分割与 3D 点云平面拟合的视觉引导抓取姿态生成策略。
  • 在番茄和洋葱上完成实验验证,证明了该方法在定向抓取与放置上的高成功率与鲁棒性,且性能显著优于 VLA 策略。
Card 04 方法描述

方法描述

  • 视觉感知模块:使用 YOLO-26 分割模型检测农产品本体与根区域,将根区域像素转换为 3D 点云,并通过 SVD 分解进行最小二乘平面拟合,估计根表面法向量以推断物体方向。
  • 抓取姿态生成:抓取位置设为根点云质心沿法向量偏移一定距离,抓取方向由法向量确定,并通过坐标系齐次变换矩阵将抓取姿态转换为机器人笛卡尔运动指令。
  • 运动规划与控制:采用基于路点的笛卡尔运动规划,确保抓取后能将农产品以直立姿态(根朝下)精准放入固定支架。
Card 05 数据集与资源

数据集与资源

  • 训练数据:通过录制农产品视频并提取帧图像进行标注,构建半自动标注的分割数据集,并进行了光照与方向增强。
  • 模型:使用了 YOLO-26 分割模型进行根区域检测。
  • 实验硬件:Fairino FR5 机械臂、Jodell RG52-050 夹持器、D405(腕部)与 D455(顶部) RGB-D 相机。
  • VLA 训练:使用 π₀ 模型,基于50个远程操作演示片段进行训练。
Card 06 评估与结果

评估与结果

  • 评估场景:在单独与杂乱两种场景下,对番茄和洋葱进行定向抓取与直立放置测试。
  • 主要指标:任务成功率(放置后根朝下,角度误差在 ±20° 以内)与执行时间。
  • 关键结果:ROG-Grasp 在单独场景下成功率达 85-90%,杂乱场景下达 80%,执行时间约 7-8秒;相比之下,VLA 方法成功率仅为 10-40%,执行时间长达 20-26秒,且在杂乱环境中易发生震荡。