本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。
- 本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。
- 框架创新:提出VITA框架,通过统一潜在空间对齐感知与动作,并将未来帧预测内化为动作生成的归纳偏置,实现正向与逆向动力学联合建模。
- 训练策略:设计渐进式训练方法(warmup + co-train + fine-tune),使模型从大规模人类演示视频中学习通用运动动态,同时过滤无关像素细节。
研究单位
南京大学计算机软件新技术国家重点实验室(State Key Laboratory for Novel Software Technology, Nanjing University)
论文概述
本文提出VITA(Vision-Integrated Trajectory Alignment)框架,旨在统一视觉感知与机器人动作生成。通过构建跨模态共享的离散潜在空间,VITA将视觉观察与低级动作对齐,并引入隐式视觉思维链(Implicit Visual Chain-of-Thought):自回归生成的token同时解码为未来帧预测和机器人动作序列,使视觉动态作为动作规划的归纳偏置。该方法解决了视觉-动作模态 gap 和训练不稳定性问题,在模拟与真实环境中实现SOTA性能。
核心贡献
- 框架创新:提出VITA框架,通过统一潜在空间对齐感知与动作,并将未来帧预测内化为动作生成的归纳偏置,实现正向与逆向动力学联合建模。
- 训练策略:设计渐进式训练方法(warmup + co-train + fine-tune),使模型从大规模人类演示视频中学习通用运动动态,同时过滤无关像素细节。
- 性能提升:在CALVIN、LIBERO和SimplerEnv模拟基准上分别提升14.5%、9.6%和12.1%,真实世界任务平均成功率达80.5%。
方法描述
- 跨模态向量量化框架:
- 视觉分支:使用DINOv2提取连续帧特征,经M-Former生成运动嵌入,通过共享码本量化后解码为未来帧(L1 + SSIM损失)。
- 动作分支:对动作序列进行离散余弦变换(DCT)和频率编码,量化后解码重建动作(MSE损失)。
- 共享码本(Codebook)统一视觉与动作表示,无需跨模态对齐数据。
- VLM主干架构:
- 渐进注意力机制:分阶段处理输入token → 文本子任务token → 跨模态token,确保信息流单向性(Input → Textual → Cross-modal)。
- 文本CoT:生成符号化子任务序列(如[GRASP], [MOVE]),作为高层规划指导。
- 隐式视觉CoT:基于子任务token生成跨模态token,同步解码为未来帧和动作序列。
- 训练流程:
- Warmup阶段:独立训练视觉/动作自编码器和共享码本,使用单模态数据(无监督重建损失)。
- Co-train阶段:冻结码本,联合训练VLM与双解码器,混合使用视频数据和同步视频-动作数据(视觉损失 + 动作损失)。
- Fine-tune阶段:仅微调动作解码器于特定任务数据。
数据集与资源
- 混合数据集:
- 人类演示视频:SSv2、Ego4D。
- 机器人数据(真实):OXE、RoboMIND。
- 机器人数据(模拟):CALVIN-ABC、LIBERO。
- 训练资源:
- 模型规模:SigLIP视觉编码器(400M) + Gemma主干(2B) + 视觉/动作解码器(共约324M)。
- 硬件:16块NVIDIA A100 GPU。
- 时长:约5天,300K训练步数。
评估与结果
- 模拟环境:
- CALVIN:多步骤家庭任务,评估连续5条指令的完成率(Average Number of Tasks)。
- LIBERO:多任务套件(GOAL/SPATIAL/OBJECT/LONG),评估任务平均成功率。
- SimplerEnv:Google Robot和WidowX平台,评估视觉匹配任务成功率。
- 真实环境:
- UR-5e机器人平台:6项桌面操作任务,评估分布内(ID)和分布外(OOD)成功率。
- 评估指标:
- CALVIN:连续任务完成率(1-5任务)及平均完成长度(Avg. Len)。
- LIBERO/SimplerEnv:任务平均成功率(%)。
- 真实世界:任务成功率(%),对比基线包括Pi0、OpenVLA、GR00T N1.5。