返回列表
VLA / Vision-Language-Action 每日论文卡
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
本文提出了一种名为 Mantis 的视觉-语言-动作 (VLA) 模型,旨在解决现有 VLA 模型面临的挑战:直接预测高维视觉状态会分散模型容量并带来高昂的训练成本,而压缩视觉状态则会引入信息瓶颈,同时现有方法常因忽视语言监督而导致理解与推理能力不佳。Mantis 引入了核心创新——解耦视觉预测 (DVF),通过结合元查询和扩散 Transformer (DiT) 头,将视觉预测任务与主干网络解耦。当前视觉状态通过残差连接提供给 DiT,使得元查询能自动捕捉描绘视觉轨迹的潜在动作,从而提升显式动作学习。这种解耦设计减轻了主干网络的负担,使其能通过语言监督保持理解和推理能力。实验表明,在 LIBERO 基准上微调后,Mantis 取得了 96.7% 的成功率,并在真实世界评估中表现出优于基线模型的指令跟随、泛化和推理能力。

论文详情

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

2025-11-20 · 原文 · 翻译 · 2511.16175

本文提出了一种名为 Mantis 的视觉-语言-动作 (VLA) 模型,旨在解决现有 VLA 模型面临的挑战:直接预测高维视觉状态会分散模型容量并带来高昂的训练成本,而压缩视觉状态则会引入信息瓶颈,同时现有方法常因忽视语言监督而导致理解与推理能力不佳。Mantis 引入了核心创新——解耦视觉预测 (DVF),通过结合元查询和扩散 Transformer (DiT) 头,将视觉预测任务与主干网络解耦。当前视觉状态通过残差连接提供给 DiT,使得元查询能自动捕捉描绘视觉轨迹的潜在动作,从而提升显式动作学习。这种解耦设计减轻了主干网络的负担,使其能通过语言监督保持理解和推理能力。实验表明,在 LIBERO 基准上微调后,Mantis 取得了 96.7% 的成功率,并在真实世界评估中表现出优于基线模型的指令跟随、泛化和推理能力。

7 分钟读完 6 张阅读卡 上海交通大学 (SJTU), 上海人工智能实验室 (SII), 南京邮电大学 (NJUPT), 复旦大…
一眼看懂 封面预览

本文提出了一种名为 Mantis 的视觉-语言-动作 (VLA) 模型,旨在解决现有 VLA 模型面临的挑战:直接预测高维视觉状态会分散模型容量并带来高昂的训练成本,而压缩视觉状态则会引入信息瓶颈,同时现有方法常因忽视语言监督而导致理解与推理能力不佳。Mantis 引入了核心创新——解耦视觉预测 (DVF),通过结合元查询和扩散 Transformer (DiT) 头,将视觉预测任务与主干网络解耦。当前视觉状态通过残差连接提供给 DiT,使得元查询能自动捕捉描绘视觉轨迹的潜在动作,从而提升显式动作学习。这种解耦设计减轻了主干网络的负担,使其能通过语言监督保持理解和推理能力。实验表明,在 LIBERO 基准上微调后,Mantis 取得了 96.7% 的成功率,并在真实世界评估中表现出优于基线模型的指令跟随、泛化和推理能力。

  • 本文提出了一种名为 Mantis 的视觉-语言-动作 (VLA) 模型,旨在解决现有 VLA 模型面临的挑战:直接预测高维视觉状态会分散模型容量并带来高昂的训练成本,而压缩视觉状态则会引入信息瓶颈,同时现有方法常因忽视语言监督而导致理解与推理能力不佳。Mantis 引入了核心创新——解耦视觉预测 (DVF),通过结合元查询和扩散 Transformer (DiT) 头,将视觉预测任务与主干网络解耦。当前视觉状态通过残差连接提供给 DiT,使得元查询能自动捕捉描绘视觉轨迹的潜在动作,从而提升显式动作学习。这种解耦设计减轻了主干网络的负担,使其能通过语言监督保持理解和推理能力。实验表明,在 LIBERO 基准上微调后,Mantis 取得了 96.7% 的成功率,并在真实世界评估中表现出优于基线模型的指令跟随、泛化和推理能力。
  • 提出了解耦视觉预测 (DVF),为动作预测提供简洁且具有指导性的前瞻线索,并构建了新的 VLA 模型 Mantis。
  • 设计了用于模态融合的渐进式训练方案,使 Mantis 能够有效地整合动作预测与语言理解。
Card 01 研究单位

研究单位

上海交通大学 (SJTU), 上海人工智能实验室 (SII), 南京邮电大学 (NJUPT), 复旦大学 (FDU), BOSCH。

Card 02 论文概述

论文概述

本文提出了一种名为 Mantis 的视觉-语言-动作 (VLA) 模型,旨在解决现有 VLA 模型面临的挑战:直接预测高维视觉状态会分散模型容量并带来高昂的训练成本,而压缩视觉状态则会引入信息瓶颈,同时现有方法常因忽视语言监督而导致理解与推理能力不佳。Mantis 引入了核心创新——解耦视觉预测 (DVF),通过结合元查询和扩散 Transformer (DiT) 头,将视觉预测任务与主干网络解耦。当前视觉状态通过残差连接提供给 DiT,使得元查询能自动捕捉描绘视觉轨迹的潜在动作,从而提升显式动作学习。这种解耦设计减轻了主干网络的负担,使其能通过语言监督保持理解和推理能力。实验表明,在 LIBERO 基准上微调后,Mantis 取得了 96.7% 的成功率,并在真实世界评估中表现出优于基线模型的指令跟随、泛化和推理能力。

Card 03 核心贡献

核心贡献

  • 提出了解耦视觉预测 (DVF),为动作预测提供简洁且具有指导性的前瞻线索,并构建了新的 VLA 模型 Mantis。
  • 设计了用于模态融合的渐进式训练方案,使 Mantis 能够有效地整合动作预测与语言理解。
  • Mantis 在 LIBERO 基准上实现了 96.7% 的成功率,并在真实世界机器人实验中展示了卓越的指令跟随能力。
Card 04 方法描述

方法描述

Mantis 的方法论包含四个主要部分:

  1. 模型概述:模型由一个 VLM 主干网络、一个连接器、一个 DVF 头和一个动作头组成。主干网络接收语言指令和当前视觉观察,并与可学习的潜在动作查询 ([LAT]) 交互。DVF 头接收主干网络输出和当前视觉状态(通过残差连接),用于预测未来的视觉状态。动作头使用可学习的动作查询 ([ACT]) 从输入和 [LAT] 查询中提取信息,以生成显式动作序列。
  2. 模型规范:主干网络采用 Qwen2.5-VL。DVF 头采用高效的文本到图像生成模型 Sana (一个 DiT)。连接器包含 12 层 Transformer 编码器和一个投影层。动作头同样基于 DiT 结构。
  3. 渐进式训练:训练分为三个阶段以稳定融合多模态信息。

- 阶段1:多时差视觉训练:在 SSV2 人类操作视频数据集上预训练,仅训练 DVF 头和 [LAT] 查询,目标是预测未来帧,让模型学习通用操作技能。

- 阶段2:视觉-动作联合训练:在 DROID 机器人演示数据集上训练,引入动作损失,并解冻动作查询。

- 阶段3:语言监督混合训练:联合使用 38 个多模态数据集和 DROID 数据进行训练,解冻主干网络并引入语言损失,以保持模型的语义理解与推理能力。

  1. 自适应时间集成 (ATE):一种推理时优化策略,用于平衡计算效率和运动稳定性。它动态识别与指令相关的“目标补丁”和发生显著变化的“动态补丁”。当二者重叠时(表示精细操作),启用时间集成以增强稳定性;否则,跳过集成以节省计算开销。该模型变体称为 Mantis-ATE。
Card 05 数据集与资源

数据集与资源

  • 数据集

- 预训练:SSV2 数据集(约 220K 个人类操作视频),DROID 数据集(76K 个机器人演示),以及 38 个多模态数据集(用于图像-文本对)。

- 微调:LIBERO 模拟基准数据集。

- 真实世界实验:在三个自定义场景中收集的 100 个远程操作演示数据集。

  • 训练资源

- 模型规模:总计 58 亿参数(主干网络 3.7B,DVF 头 1.4B,动作头 0.3B,VAE 0.3B)。

- 优化器:使用 AdamW 优化器,权重衰减为 0.1,梯度裁剪为 0.5。

- 训练框架:使用 DeepSpeed 进行高效分布式训练。

Card 06 评估与结果

评估与结果

  • 评估环境

- 模拟环境:LIBERO 基准,包含四个任务套件(Spatial, Object, Goal, Long)。

- 真实世界环境:Agilex 机器人平台。

  • 评估指标

- LIBERO 基准:成功率 (Success Rate, SR),范围为 0 到 100,越高越好。

- 真实世界实验:平均成功执行次数(每个指令执行 10 次,取平均成功数)。

- Mantis-ATE 效率:推理次数 和成功率 (SR),用于评估计算效率和任务性能。