返回列表
VLA / Vision-Language-Action 每日论文卡
HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning
提出了 HapTile,一个面向接触丰富模仿学习的多模态、接触驱动的操作数据集,旨在解决现有 VLA 数据集缺乏触觉信息、语言条件与动作轨迹联合提供的问题。

论文详情

HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning

2026-06-03 · 原文 · 翻译 · 2606.04825

提出了 HapTile,一个面向接触丰富模仿学习的多模态、接触驱动的操作数据集,旨在解决现有 VLA 数据集缺乏触觉信息、语言条件与动作轨迹联合提供的问题。 数据集通过集成触觉反馈的遥操作平台收集,包含同步的视觉、指尖触觉、机器人本体状态、语言指令和动作轨迹。 论文旨在为研究接触感知策略学习和触觉-视觉-语言-动作模型提供基础资源。

5 分钟读完 6 张阅读卡 King's College London, UK
一眼看懂 封面预览

提出了 HapTile,一个面向接触丰富模仿学习的多模态、接触驱动的操作数据集,旨在解决现有 VLA 数据集缺乏触觉信息、语言条件与动作轨迹联合提供的问题。

  • 提出了 HapTile,一个面向接触丰富模仿学习的多模态、接触驱动的操作数据集,旨在解决现有 VLA 数据集缺乏触觉信息、语言条件与动作轨迹联合提供的问题。
  • 数据集通过集成触觉反馈的遥操作平台收集,包含同步的视觉、指尖触觉、机器人本体状态、语言指令和动作轨迹。
  • 论文旨在为研究接触感知策略学习和触觉-视觉-语言-动作模型提供基础资源。
Card 01 研究单位

研究单位

  • King's College London, UK
  • Huawei, Noah’s Ark Lab, UK
  • University College London, UK
Card 02 论文概述

论文概述

  • 提出了 HapTile,一个面向接触丰富模仿学习的多模态、接触驱动的操作数据集,旨在解决现有 VLA 数据集缺乏触觉信息、语言条件与动作轨迹联合提供的问题。
  • 数据集通过集成触觉反馈的遥操作平台收集,包含同步的视觉、指尖触觉、机器人本体状态、语言指令和动作轨迹。
  • 论文旨在为研究接触感知策略学习和触觉-视觉-语言-动作模型提供基础资源。
Card 03 核心贡献

核心贡献

  • 构建了一个多模态、接触驱动的日常操作数据集,包含 1,726 个演示,覆盖 38 个任务和 9 种操作技能,使用可普遍部署的机器人平台收集。
  • 在遥操作流程中嵌入了触觉反馈,并记录在数据集中,以提升演示质量和操作员的接触感知。
  • 提出了一种低成本、可复现的视觉基触觉传感器,兼容工业及开源夹爪,适用于大规模数据收集。
  • 语言指令用作策略条件信号而非描述性元数据,首次将语言条件、触觉感知和机器人动作轨迹与触觉引导演示相结合。
  • 承诺开源数据集和代码,以支持可复现的数据收集。
Card 04 方法描述

方法描述

  • 使用包含 UR5e 机械臂、Robotiq 2F-85 夹爪和定制指尖触觉传感器的遥操作系统进行数据收集。
  • 采用视觉基触觉传感器,利用卢卡斯-卡纳德光流法跟踪标记点位移,实时估计触觉表面运动,并通过归一化处理生成触觉反馈信号传递给操作员。
  • 动作数据转换为统一的7维末端执行器增量表示(平移、旋转和夹爪命令),使策略学习与具体机器人配置解耦。
  • 数据处理包括多模态同步、数据质量检查(如轨迹去空、时间戳检查、动作-状态一致性)。
Card 05 数据集与资源

数据集与资源

  • 数据集名称:HapTile
  • 演示数量:1,726 条,总计 750.33 分钟交互数据
  • 任务与技能:38 个任务,9 种操作技能,包含 YCB 对象集
  • 传感器:定制视觉基触觉传感器(尺寸约 20mm×23mm×37mm,有效感知区域 16mm×29.5mm),腕部和第三人称 RGB 相机
  • 机器人平台:UR5e 机械臂,Robotiq 2F-85 夹爪
  • 数据采集频率:15 Hz
Card 06 评估与结果

评估与结果

  • 评估基准:使用 Diffusion Policyπ₀ 两个基线模型,在四个高接触需求任务上进行策略学习评估。
  • 评估环境:真实机器人部署,报告 10 次演示的成功率
  • 主要评估指标:任务成功率(%)
  • 关键实验结果

- 加入触觉输入后,模型性能普遍提升或持平,但最优触觉表示取决于任务物理特性。例如,π₀ 在插钉任务中,仅视觉输入成功率为 0%,加入原始触觉图像后提升至 90%

- 视觉+触觉+标记跟踪(V+TM)在擦白板任务中使 π₀ 的成功率达到 100%,在立瓶任务中使 Diffusion Policy 的成功率达到 90%

- 原始触觉图像和标记跟踪位移两种触觉表示具有互补性:前者利于精确接触定位,后者利于力和剪切力依赖任务。