返回列表
VLA / Vision-Language-Action 每日论文卡
Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation
本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。

论文详情

Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

2025-11-25 · 原文 · 翻译 · 2511.19859

本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。

6 分钟读完 6 张阅读卡 南京大学计算机软件新技术国家重点实验室(State Key Laboratory for Novel…
一眼看懂 封面预览

本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。

  • 本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。
  • 框架创新:提出VITA框架,通过统一潜在空间对齐感知与动作,并将未来帧预测内化为动作生成的归纳偏置,实现正向与逆向动力学联合建模。
  • 训练策略:设计渐进式训练方法(warmup + co-train + fine-tune),使模型从大规模人类演示视频中学习通用运动动态,同时过滤无关像素细节。
Card 01 研究单位

研究单位

南京大学计算机软件新技术国家重点实验室(State Key Laboratory for Novel Software Technology, Nanjing University)

Card 02 论文概述

论文概述

本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。

Card 03 核心贡献

核心贡献

  1. 框架创新:提出VITA框架,通过统一潜在空间对齐感知与动作,并将未来帧预测内化为动作生成的归纳偏置,实现正向与逆向动力学联合建模。
  2. 训练策略:设计渐进式训练方法(warmup + co-train + fine-tune),使模型从大规模人类演示视频中学习通用运动动态,同时过滤无关像素细节。
  3. 性能提升:在CALVIN、LIBERO和SimplerEnv模拟基准上分别提升14.5%、9.6%和12.1%,真实世界任务平均成功率达80.5%。
Card 04 方法描述

方法描述

  1. 跨模态向量量化框架

- 视觉分支:使用DINOv2提取连续帧特征,经M-Former生成运动嵌入,通过共享码本量化后解码为未来帧(L1 + SSIM损失)。

- 动作分支:对动作序列进行离散余弦变换(DCT)和频率编码,量化后解码重建动作(MSE损失)。

- 共享码本(Codebook)统一视觉与动作表示,无需跨模态对齐数据。

  1. VLM主干架构

- 渐进注意力机制:分阶段处理输入token → 文本子任务token → 跨模态token,确保信息流单向性(Input → Textual → Cross-modal)。

- 文本CoT:生成符号化子任务序列(如[GRASP], [MOVE]),作为高层规划指导。

- 隐式视觉CoT:基于子任务token生成跨模态token,同步解码为未来帧和动作序列。

  1. 训练流程

- Warmup阶段:独立训练视觉/动作自编码器和共享码本,使用单模态数据(无监督重建损失)。

- Co-train阶段:冻结码本,联合训练VLM与双解码器,混合使用视频数据和同步视频-动作数据(视觉损失 + 动作损失)。

- Fine-tune阶段:仅微调动作解码器于特定任务数据。

Card 05 数据集与资源

数据集与资源

  1. 混合数据集

- 人类演示视频:SSv2、Ego4D。

- 机器人数据(真实):OXE、RoboMIND。

- 机器人数据(模拟):CALVIN-ABC、LIBERO。

  1. 训练资源

- 模型规模:SigLIP视觉编码器(400M) + Gemma主干(2B) + 视觉/动作解码器(共约324M)。

- 硬件:16块NVIDIA A100 GPU。

- 时长:约5天,300K训练步数。

Card 06 评估与结果

评估与结果

  1. 模拟环境

- CALVIN:多步骤家庭任务,评估连续5条指令的完成率(Average Number of Tasks)。

- LIBERO:多任务套件(GOAL/SPATIAL/OBJECT/LONG),评估任务平均成功率。

- SimplerEnv:Google Robot和WidowX平台,评估视觉匹配任务成功率。

  1. 真实环境

- UR-5e机器人平台:6项桌面操作任务,评估分布内(ID)和分布外(OOD)成功率。

  1. 评估指标

- CALVIN:连续任务完成率(1-5任务)及平均完成长度(Avg. Len)。

- LIBERO/SimplerEnv:任务平均成功率(%)。

- 真实世界:任务成功率(%),对比基线包括Pi0、OpenVLA、GR00T N1.5。