返回列表
VLA / Vision-Language-Action 每日论文卡
Threading Optimization for Vision-Language-Action Model Inference in Low-Cost Smart Agricultural Manipulation
论文针对视觉-语言-动作(VLA)模型在机器人操作中面临的推理延迟高和难以进行精细动作调整的问题进行研究

论文详情

Threading Optimization for Vision-Language-Action Model Inference in Low-Cost Smart Agricultural Manipulation

2026-05-31 · 原文 · 翻译 · 2606.00966

论文针对视觉-语言-动作(VLA)模型在机器人操作中面临的推理延迟高和难以进行精细动作调整的问题进行研究 旨在弥合实时动作分块算法(RTAC)的理论伪代码与低成本机器人硬件实际部署之间的工程差距 提出了一种针对低成本机械臂(Fairino FR5)的系统级线程优化实现,以降低端到端延迟并提高控制稳定性

4 分钟读完 6 张阅读卡 Drexel University 电气工程系(美国费城)
一眼看懂 封面预览

论文针对视觉-语言-动作(VLA)模型在机器人操作中面临的推理延迟高和难以进行精细动作调整的问题进行研究

  • 论文针对视觉-语言-动作(VLA)模型在机器人操作中面临的推理延迟高和难以进行精细动作调整的问题进行研究
  • 旨在弥合实时动作分块算法(RTAC)的理论伪代码与低成本机器人硬件实际部署之间的工程差距
  • 提出了一种针对低成本机械臂(Fairino FR5)的系统级线程优化实现,以降低端到端延迟并提高控制稳定性
Card 01 研究单位

研究单位

  • Drexel University 电气工程系(美国费城)
Card 02 论文概述

论文概述

  • 论文针对视觉-语言-动作(VLA)模型在机器人操作中面临的推理延迟高和难以进行精细动作调整的问题进行研究
  • 旨在弥合实时动作分块算法(RTAC)的理论伪代码与低成本机器人硬件实际部署之间的工程差距
  • 提出了一种针对低成本机械臂(Fairino FR5)的系统级线程优化实现,以降低端到端延迟并提高控制稳定性
Card 03 核心贡献

核心贡献

  • 构建了一个低成本、易获取的硬件平台,包括 Fairino FR5 机械臂、双摄像头设置和基于 GELLO 框架的遥操作接口
  • 提出了一种改进的线程优化方案,通过生产者-消费者架构将策略推理与驱动执行解耦,最小化端到端延迟
  • 验证了该系统能够比基线控制方案更快、更稳定地完成农产品(蒜头、核桃)的抓取任务
  • 首次深入探索了将 RTAC 集成到物理 VLA 流程中的系统级挑战,解决了 Python GIL 限制导致的并发问题
Card 04 方法描述

方法描述

  • 采用双线程架构:线程 0 专用于引导式推理生成动作块,线程 1 专用于物理硬件执行
  • 结合了 PaliGemma LoRA VLA 模型和 $\pi_0$ 动作专家进行动作块生成
  • 使用引导流匹配时间修复技术确保新旧动作块之间的平滑过渡
  • 利用 concurrent.futures 线程池管理器和 JAX JIT 编译,在 GPU 内核执行期间释放 Python GIL,实现真正的并发执行
Card 05 数据集与资源

数据集与资源

  • 通过 GELLO 遥操作手臂收集自定义演示数据用于微调
  • 机器人硬件:Fairino FR5 协作机器人(成本 < $4,000),负载 5kg,臂展 854mm
  • 视觉传感器:Intel Realsense D405(手腕)和 D455(侧方)
  • 计算资源:配备 NVIDIA RTX 4090 GPU(24GB VRAM)的工作站
Card 06 评估与结果

评估与结果

  • 评估任务:抓取蒜头放入碗中、依次抓取两个核桃放入碗中
  • 评估指标:任务完成时间和完整回合(1000个动作)完成时间
  • 在蒜头任务中,优化后的 RTAC 相比标准 $\pi_0$ 实现 25.6% 的加速,相比标准 RTAC 实现 6.0% 的加速
  • 在核桃任务中,优化后的 RTAC 相比标准 $\pi_0$ 实现 11.9% 的加速,相比标准 RTAC 实现 6.8% 的加速
  • 实验轨迹显示优化方法在保持动作平滑度的同时显著提高了执行速度