一眼看懂
封面预览
提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理
- 提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理
- 核心洞察是将3D几何感知与3D空间推理视为两种可解耦的能力,并在不同的特征层级注入,从而解决VLA模型缺乏3D空间理解的问题
- 解决的问题:现有VLA模型主要依赖2D图像,缺乏3D几何感知和空间推理;显式引入3D信息的方法依赖外部传感器或修改模型结构,且存在提示诱导的推理差距
Card 01
研究单位
研究单位
- 上海交通大学
- 哈尔滨工业大学
- 南洋理工大学
- 复旦大学
- 南京大学
- Daimon Robotics
- 大湾区大学
Card 02
论文概述
论文概述
- 提出 3DThinkVLA,一个基于3D思维引导的协同训练框架,旨在让视觉-语言-动作(VLA)模型在动作预测时隐式地进行3D空间推理
- 核心洞察是将3D几何感知与3D空间推理视为两种可解耦的能力,并在不同的特征层级注入,从而解决VLA模型缺乏3D空间理解的问题
- 解决的问题:现有VLA模型主要依赖2D图像,缺乏3D几何感知和空间推理;显式引入3D信息的方法依赖外部传感器或修改模型结构,且存在提示诱导的推理差距
Card 03
核心贡献
核心贡献
- 识别并刻画了VLA协同训练中的提示诱导推理差距,揭示标准动作提示会抑制已学习的空间先验,导致次优的动作捷径
- 提出 3DThinkVLA 框架,通过三个紧密耦合的组件解耦几何感知与空间推理:潜在3D几何感知模块、在线3D推理蒸馏模块和空间增强动作集成模块
- 引入在线3D推理蒸馏机制,利用共享推理锚点令牌,在隐空间中从推理提示到动作提示传递高级空间思维,无需显式文本生成
- 在 LIBERO、LIBERO-PLUS、SimplerEnv 和真实机器人基准上取得最先进性能,同时实现推理时无需3D传感器、外部基础模型或思维链生成
Card 04
方法描述
方法描述
- 潜在3D几何感知模块:通过轻量级几何适配器(MLP+LayerNorm)将视觉编码器中间层特征与3D基础模型(VGGT)进行块级隐空间对齐,捕获低级几何线索,不修改VLM主干
- 在线3D推理蒸馏模块:设计共享推理锚点令牌,插入任务指令后;教师分支使用显式3D推理提示,学生分支使用标准动作提示,通过轻量级推理适配器进行隐空间令牌级蒸馏,关闭推理差距
- 空间增强动作集成模块:将几何感知特征和推理对齐令牌投影到动作隐空间,通过逐元素加法注入动作查询令牌,作为层次化空间条件引导动作预测,并随机丢弃以防止过拟合
- 协同训练:同时使用VLA数据和3D推理VLM数据进行训练,VLM流要求模型首先输出推理锚点令牌,以强化其空间推理表征;训练时仅保留轻量适配器,推理时丢弃3D基础模型和教师分支
Card 05
数据集与资源
数据集与资源
- 仿真基准:LIBERO(4个任务套件)、LIBERO-PLUS(7个扰动维度)、SimplerEnv(WidowX 4个任务)
- 真实世界任务:高度变化泛化、透明容器放置、空间位置理解
- 3D协同训练数据:基于真实世界图像的3D空间推理对话和问答数据(包含3D边界框、距离、方向等)
- 模型骨干:Qwen3-VL-2B(2B参数),使用OFT风格动作头
- 训练资源:8块 NVIDIA A100 (80GB) GPU;推理部署在单块A100 GPU上
Card 06
评估与结果
评估与结果
- 在 LIBERO 基准上,平均成功率达到 98.7%,在Spatial和Object套件上达到 100%,超越所有对比方法
- 在 LIBERO-PLUS 零样本泛化评估中,平均成功率达到 81.0%,在高度变化等空间扰动上表现显著优于基线
- 在 SimplerEnv 上,平均成功率达到 72.9%,取得最佳性能
- 真实世界实验中,3个任务的成功率均优于对比方法(如 π0),验证了高度理解、透明物体定位和空间推理能力
- 消融实验表明,协同训练、几何适配器、推理适配器和推理锚点均带来正向收益,各组件互补,全模型达到最优