返回列表
VLA / Vision-Language-Action 每日论文卡
VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training
针对使用 UMI(Universal Manipulation Interface) 数据训练大规模 VLA(Vision-Language-Action) 模型面临的视觉基础不匹配和物理可行性不匹配两大挑战,提出 VISTA 框架

论文详情

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

2026-06-03 · 原文 · 翻译 · 2606.04708

针对使用 UMI(Universal Manipulation Interface) 数据训练大规模 VLA(Vision-Language-Action) 模型面临的视觉基础不匹配和物理可行性不匹配两大挑战,提出 VISTA 框架 手腕式鱼眼相机视角导致预训练 VLM 出现分布外问题,且人类采集的轨迹常违反运动学约束、存在碰撞风险或超出控制器带宽,需从物理可行性上对齐 通过构建大规模鱼眼 VQA 数据集、设计轨迹级物理验证流程以及两阶段联合训练,使 UMI 数据适配 VLA 训练,并在多机器人平台上实现高效部署

7 分钟读完 6 张阅读卡 Institute of AI (TeleAI), China Telecom
一眼看懂 封面预览

针对使用 UMI(Universal Manipulation Interface) 数据训练大规模 VLA(Vision-Language-Action) 模型面临的视觉基础不匹配和物理可行性不匹配两大挑战,提出 VISTA 框架

  • 针对使用 UMI(Universal Manipulation Interface) 数据训练大规模 VLA(Vision-Language-Action) 模型面临的视觉基础不匹配和物理可行性不匹配两大挑战,提出 VISTA 框架
  • 手腕式鱼眼相机视角导致预训练 VLM 出现分布外问题,且人类采集的轨迹常违反运动学约束、存在碰撞风险或超出控制器带宽,需从物理可行性上对齐
  • 通过构建大规模鱼眼 VQA 数据集、设计轨迹级物理验证流程以及两阶段联合训练,使 UMI 数据适配 VLA 训练,并在多机器人平台上实现高效部署
Card 01 研究单位

研究单位

  • Institute of AI (TeleAI), China Telecom
  • Lumos Robotics
  • University of Science and Technology of China
  • Northwestern Polytechnical University
  • Shanghai Jiao Tong University
  • East China University of Science and Technology
  • Harbin Engineering University
  • Fudan University
Card 02 论文概述

论文概述

  • 针对使用 UMI(Universal Manipulation Interface) 数据训练大规模 VLA(Vision-Language-Action) 模型面临的视觉基础不匹配和物理可行性不匹配两大挑战,提出 VISTA 框架
  • 手腕式鱼眼相机视角导致预训练 VLM 出现分布外问题,且人类采集的轨迹常违反运动学约束、存在碰撞风险或超出控制器带宽,需从物理可行性上对齐
  • 通过构建大规模鱼眼 VQA 数据集、设计轨迹级物理验证流程以及两阶段联合训练,使 UMI 数据适配 VLA 训练,并在多机器人平台上实现高效部署
Card 03 核心贡献

核心贡献

  • 识别并形式化 UMI 数据适配 VLA 时的两个关键瓶颈:视觉基础不匹配(手腕鱼眼视图与标准视角 VLM 预训练域差异)和物理可行性不匹配(人类采集轨迹与目标机器人本体约束冲突)
  • 提出 VISTA 框架,包含 UMI‑VQA(首个面向手腕鱼眼的大规模 VQA 数据集)、系统化的轨迹级物理验证流程以及基于流匹配的两阶段联合训练方案
  • 发布 UMI‑VQA(8M 样本)和经过物理验证的 UMI 轨迹数据,为可扩展机器人学习提供数据支持
  • 在 20 个真实世界操作任务和两个 UMI 风格仿真基准上,VISTA 显著优于 π₀.₅LingBot‑VLAWall‑X 等强基线
Card 04 方法描述

方法描述

  • UMI‑VQA 数据集:从真实 UMI 演示帧中通过半自动标注生成 3M 样本,覆盖物体定位、场景理解、交互定位、空间推理等能力;同时利用扩散模型(FLUX.2‑dev)将标准视角的 RefSpatial 图像转换为鱼眼风格,扩展 5M 空间多样性样本
  • 物理验证流程:在 MuJoCo 仿真中重放 UMI 轨迹,对每条轨迹进行轨迹连续性、自碰撞风险和执行保真度三个维度的评分,采用加权乘积模型计算综合得分,支持跨本体预训练和下游本体精细筛选
  • 两阶段训练:第一阶段对 VLM 骨干进行 VQA 和离散动作 token 的自回归联合训练,实现视觉‑语言‑动作表征对齐;第二阶段冻结骨干,训练知识隔离的流匹配动作专家,生成连续动作块
  • 多机器人部署系统:基于 Zenoh 中间件实现分布式推理与动作分发,支持异构机器人平台的透明扩展
Card 05 数据集与资源

数据集与资源

  • UMI‑VQA:总计 8M 样本,包含 3M 真实手腕鱼眼 VQA 对和 5M 鱼眼风格空间多样性 VQA 补充数据
  • 预训练数据:100K 经过物理验证的真实世界 UMI 轨迹
  • 模型基础:基于 π₀.₅ 检查点初始化,VLM 骨干规模约 3‑4B 参数(文中未明确给出 VISTA 最终参数量,但提及对比模型如 Qwen2.5VL‑3B、Qwen3VL‑4B 等)
  • 训练资源:文中未披露具体 GPU 类型和数量,但提及使用多 GPU 分布式训练
Card 06 评估与结果

评估与结果

  • 评估环境:UMI 风格仿真基准 RoboTwin‑UMILIBERO‑UMI,以及 20 个真实世界操作任务(涵盖堆叠、放置、抽屉拉取等)
  • 主要指标:成功率(Success Rate)、抓取成功率(GSR)、整体成功率(OSR)、抓取后成功率(PSR)、位置/角度误差等
  • 诊断实验:手腕鱼眼观测导致 π₀.₅ 在 RoboTwin 上成功率从 82.0% 降至 59.4%,在 LIBERO 上从 96.3% 降至 92.2%;VLM 在鱼眼图像上的空间推理平均性能下降 8.6%
  • 数据级验证:UMI‑VQA 联合训练使 π₀.₅ 在三个真实任务上的总体成功率从 45.0% 提升到 55.0%;高物理验证分数的轨迹子集在真实机器人上部署成功率达 65%,而低分轨迹子集完全失败
  • 模型级验证:在仿真和真实世界任务中,VISTA 的性能均显著超过 π₀.₅、LingBot‑VLA、Wall‑X 等基线,消融实验进一步证实各组件对最终效果的贡献