返回列表
VLA / Vision-Language-Action 每日论文卡
3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training
提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理

论文详情

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

2026-06-03 · 原文 · 翻译 · 2606.04436

提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理 核心洞察是将3D几何感知与3D空间推理视为两种可解耦的能力,并在不同的特征层级注入,从而解决VLA模型缺乏3D空间理解的问题 解决的问题:现有VLA模型主要依赖2D图像,缺乏3D几何感知和空间推理;显式引入3D信息的方法依赖外部传感器或修改模型结构,且存在提示诱导的推理差距

5 分钟读完 6 张阅读卡 上海交通大学
一眼看懂 封面预览

提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理

  • 提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理
  • 核心洞察是将3D几何感知与3D空间推理视为两种可解耦的能力,并在不同的特征层级注入,从而解决VLA模型缺乏3D空间理解的问题
  • 解决的问题:现有VLA模型主要依赖2D图像,缺乏3D几何感知和空间推理;显式引入3D信息的方法依赖外部传感器或修改模型结构,且存在提示诱导的推理差距
Card 01 研究单位

研究单位

  • 上海交通大学
  • 哈尔滨工业大学
  • 南洋理工大学
  • 复旦大学
  • 南京大学
  • Daimon Robotics
  • 大湾区大学
Card 02 论文概述

论文概述

  • 提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理
  • 核心洞察是将3D几何感知与3D空间推理视为两种可解耦的能力,并在不同的特征层级注入,从而解决VLA模型缺乏3D空间理解的问题
  • 解决的问题:现有VLA模型主要依赖2D图像,缺乏3D几何感知和空间推理;显式引入3D信息的方法依赖外部传感器或修改模型结构,且存在提示诱导的推理差距
Card 03 核心贡献

核心贡献

  • 识别并刻画了VLA协同训练中的提示诱导推理差距,揭示标准动作提示会抑制已学习的空间先验,导致次优的动作捷径
  • 提出 3DThinkVLA 框架,通过三个紧密耦合的组件解耦几何感知与空间推理:潜在3D几何感知模块在线3D推理蒸馏模块空间增强动作集成模块
  • 引入在线3D推理蒸馏机制,利用共享推理锚点令牌,在隐空间中从推理提示到动作提示传递高级空间思维,无需显式文本生成
  • LIBEROLIBERO-PLUSSimplerEnv 和真实机器人基准上取得最先进性能,同时实现推理时无需3D传感器、外部基础模型或思维链生成
Card 04 方法描述

方法描述

  • 潜在3D几何感知模块:通过轻量级几何适配器(MLP+LayerNorm)将视觉编码器中间层特征与3D基础模型(VGGT)进行块级隐空间对齐,捕获低级几何线索,不修改VLM主干
  • 在线3D推理蒸馏模块:设计共享推理锚点令牌,插入任务指令后;教师分支使用显式3D推理提示,学生分支使用标准动作提示,通过轻量级推理适配器进行隐空间令牌级蒸馏,关闭推理差距
  • 空间增强动作集成模块:将几何感知特征和推理对齐令牌投影到动作隐空间,通过逐元素加法注入动作查询令牌,作为层次化空间条件引导动作预测,并随机丢弃以防止过拟合
  • 协同训练:同时使用VLA数据和3D推理VLM数据进行训练,VLM流要求模型首先输出推理锚点令牌,以强化其空间推理表征;训练时仅保留轻量适配器,推理时丢弃3D基础模型和教师分支
Card 05 数据集与资源

数据集与资源

  • 仿真基准:LIBERO(4个任务套件)、LIBERO-PLUS(7个扰动维度)、SimplerEnv(WidowX 4个任务)
  • 真实世界任务:高度变化泛化、透明容器放置、空间位置理解
  • 3D协同训练数据:基于真实世界图像的3D空间推理对话和问答数据(包含3D边界框、距离、方向等)
  • 模型骨干:Qwen3-VL-2B(2B参数),使用OFT风格动作头
  • 训练资源:8块 NVIDIA A100 (80GB) GPU;推理部署在单块A100 GPU上
Card 06 评估与结果

评估与结果

  • LIBERO 基准上,平均成功率达到 98.7%,在Spatial和Object套件上达到 100%,超越所有对比方法
  • LIBERO-PLUS 零样本泛化评估中,平均成功率达到 81.0%,在高度变化等空间扰动上表现显著优于基线
  • SimplerEnv 上,平均成功率达到 72.9%,取得最佳性能
  • 真实世界实验中,3个任务的成功率均优于对比方法(如 π0),验证了高度理解、透明物体定位和空间推理能力
  • 消融实验表明,协同训练、几何适配器、推理适配器和推理锚点均带来正向收益,各组件互补,全模型达到最优