返回列表
VLA / Vision-Language-Action 每日论文卡
SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos
针对现有演示条件化视觉语言动作模型(VLA)在跨具身任务、需要精准定位小交互区域的精度敏感任务(如按下咖啡机小按钮、打开水龙头)上表现不佳的问题,本文提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强演示的精准空间定位能力,降低对任务专属遥操作数据的依赖

论文详情

SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos

2026-06-01 · 原文 · 翻译 · 2606.02745

针对现有演示条件化视觉语言动作模型(VLA)在跨具身任务、需要精准定位小交互区域的精度敏感任务(如按下咖啡机小按钮、打开水龙头)上表现不佳的问题,本文提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强演示的精准空间定位能力,降低对任务专属遥操作数据的依赖 针对现有跨具身演示条件化策略缺乏可复现评估基准的问题,本文发布RoboCasa-DC基准,支持同具身/跨具身演示的条件化策略评估,填补了该领域的评估空白 研究目标为实现仅通过单个人类或其他具身的演示视频即可驱动机器人完成未见过的操作任务,提升演示条件化策略的跨任务、跨具身泛化能力

9 分钟读完 6 张阅读卡 Georgia Institute of Technology(佐治亚理工学院)
一眼看懂 封面预览

针对现有演示条件化视觉语言动作模型(VLA)在跨具身任务、需要精准定位小交互区域的精度敏感任务(如按下咖啡机小按钮、打开水龙头)上表现不佳的问题,本文提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强演示的精准空间定位能力,降低对任务专属遥操作数据的依赖

  • 针对现有演示条件化视觉语言动作模型(VLA)在跨具身任务、需要精准定位小交互区域的精度敏感任务(如按下咖啡机小按钮、打开水龙头)上表现不佳的问题,本文提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强演示的精准空间定位能力,降低对任务专属遥操作数据的依赖
  • 针对现有跨具身演示条件化策略缺乏可复现评估基准的问题,本文发布RoboCasa-DC基准,支持同具身/跨具身演示的条件化策略评估,填补了该领域的评估空白
  • 研究目标为实现仅通过单个人类或其他具身的演示视频即可驱动机器人完成未见过的操作任务,提升演示条件化策略的跨任务、跨具身泛化能力
Card 01 研究单位

研究单位

  • Georgia Institute of Technology(佐治亚理工学院)
  • Allen Institute for AI(艾伦人工智能研究所)
  • Johns Hopkins University(约翰斯霍普金斯大学)
  • University of Washington(华盛顿大学)
Card 02 论文概述

论文概述

  • 针对现有演示条件化视觉语言动作模型(VLA)在跨具身任务、需要精准定位小交互区域的精度敏感任务(如按下咖啡机小按钮、打开水龙头)上表现不佳的问题,本文提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强演示的精准空间定位能力,降低对任务专属遥操作数据的依赖
  • 针对现有跨具身演示条件化策略缺乏可复现评估基准的问题,本文发布RoboCasa-DC基准,支持同具身/跨具身演示的条件化策略评估,填补了该领域的评估空白
  • 研究目标为实现仅通过单个人类或其他具身的演示视频即可驱动机器人完成未见过的操作任务,提升演示条件化策略的跨任务、跨具身泛化能力
Card 03 核心贡献

核心贡献

  • 提出SeeTraceAct演示条件化VLA框架,通过可见性感知的未来末端执行器轨迹预测辅助任务,实现跨具身演示的精准空间grounding;推理时丢弃轨迹解码器,仅需视觉潜规划即可生成动作,无额外推理开销
  • 发布RoboCasa-DC演示条件化机器人操作基准,包含24个日常厨房操作任务,配套同具身(Panda机械臂)和跨具身(GR-1人形机器人模拟演示)的配对演示数据,支持可复现的策略评估
  • 实验证明SeeTraceActRoboCasa-DC全部4种评估设置和真实世界基准上均取得最优性能,真实场景平均成功率较最强基线提升12.5个百分点
  • 通过消融实验验证了可见性感知轨迹监督、动作感知视频编码器等关键设计选择的必要性,发现轨迹监督对精度敏感任务的增益尤为显著
Card 04 方法描述

方法描述

  • 基础架构基于GR00T N1.5构建,包含视觉语言模型(VLM)和基于流匹配的动作专家两个核心模块,接收相机观测、语言指令、演示视频和机器人状态输入,输出动作块
  • 演示视频编码:使用预训练的V-JEPA 2视频编码器提取演示视频特征,通过Perceiver Resampler将8192维特征压缩为32个紧凑的视频token,注入VLM输入序列,结合因果注意力机制使演示表征依赖当前观测和语言指令,实现上下文相关的演示编码
  • 视觉潜规划:在VLM输入序列后追加一组可学习的查询token,其最终隐藏状态构成视觉潜规划,编码任务相关的未来运动信息,用于指导动作生成
  • 可见性感知轨迹解码器:训练时添加辅助轨迹监督分支,包含坐标回归头(预测末端执行器归一化2D图像坐标)和有效性预测头(预测轨迹点是否在相机视野内),解决末端执行器离开视野时坐标监督信号失效的问题;推理时丢弃该解码器,仅使用视觉潜规划生成动作
  • 训练目标结合两项损失:一是流匹配动作预测损失,训练动作专家预测速度场;二是可见性感知视觉轨迹损失,由掩码L1回归损失和二分类有效性损失加权组成,用于塑造视觉潜规划的空间感知能力
Card 05 数据集与资源

数据集与资源

  • 使用的数据集:

- RoboCasa-DC:模拟基准,扩展自RoboCasa环境,包含24个厨房操作任务,每个任务配备100组Panda机械臂同具身训练演示、100组GR-1人形机器人跨具身训练演示,以及50组跨具身评估演示

- 真实世界桌面操作基准:包含4个 seen任务、4个unseen任务,每个 seen任务配备150组Franka Panda机械臂与人类演示的配对数据

  • 模型规模:基于GR00T N1.5 backbone,演示视频编码后输出32个视频token,轨迹预测使用可学习查询token(具体数量见论文附录)
  • 训练资源与超参数:所有基线统一基于GR00T N1.5 backbone实现;训练步数50000步,batch size 128,优化器为AdamW(β₁=0.95,β₂=0.999,ε=1e-8),学习率1e-4,权重衰减1e-5,2500步warmup,余弦学习率调度,梯度裁剪范数1.0
Card 06 评估与结果

评估与结果

  • 评估环境与基准:RoboCasa-DC模拟基准(包含类别均衡、精度敏感两个任务划分,每个划分保留5个未见任务作为评估集,支持同具身/跨具身演示条件输入)、真实世界Franka Panda桌面操作基准
  • 主要评估指标:任务成功率(success rate),每个任务评估50个模拟 episode或10个真实世界 trial
  • 关键实验结果:

- 在RoboCasa-DC全部4种评估设置上均取得最高成功率:类别均衡同具身23.0%、类别均衡跨具身11.6%、精度敏感同具身14.1%、精度敏感跨具身12.8%,优于Vid2RobotUniSkillViVLA三个竞争基线

- 在真实世界基准上,平均成功率达50.0%,较最强基线(37.5%)提升12.5个百分点,在全部4个未见任务上均取得最优性能

- 消融实验显示:移除轨迹监督后成功率降至9.4%,接近无演示的GR00T N1.5 backbone的9.0%;移除有效性头后成功率降至8.2%,证明可见性感知轨迹监督的必要性;2D图像空间轨迹监督优于3D轨迹监督

- 相关性分析显示:任务目标交互比(TIR,数值越小代表精度敏感度越高)与SeeTraceAct相对基线的增益呈显著负相关(Spearman ρ=-0.63,p<1e-3),证明方法对精度敏感任务的增益尤为突出