一眼看懂
封面预览
当前的视觉-语言-动作(VLA)模型通常优化语义理解,但在执行需要精细几何推理的精确操作时表现不佳。
- 当前的视觉-语言-动作(VLA)模型通常优化语义理解,但在执行需要精细几何推理的精确操作时表现不佳。
- 提出了 GeoAlign,一种状态引导的空间对齐架构,通过在策略学习中引入几何感知特征来增强 VLA 模型的可执行操作能力。
- 核心目标是解决 VLA 模型在语义理解与几何空间对齐之间的差距,使动作生成能利用与机器人当前状态相关的局部空间信息。
Card 01
研究单位
研究单位
- Tongji University
- Shanghai Innovation Institute
- Shanghai Jiao Tong University
- Zhejiang University
- Jingdezhen Ceramic University
- Tsinghua University
- HONOR
- University of Science and Technology of China
Card 02
论文概述
论文概述
- 当前的视觉-语言-动作(VLA)模型通常优化语义理解,但在执行需要精细几何推理的精确操作时表现不佳。
- 提出了 GeoAlign,一种状态引导的空间对齐架构,通过在策略学习中引入几何感知特征来增强 VLA 模型的可执行操作能力。
- 核心目标是解决 VLA 模型在语义理解与几何空间对齐之间的差距,使动作生成能利用与机器人当前状态相关的局部空间信息。
Card 03
核心贡献
核心贡献
- 状态引导的空间对齐架构:提出一种新架构,利用机器人的本体感知状态主动查询几何特征网格,提取紧凑的、与操作阶段相关的几何 Token,用于指导动作生成。
- 几何增强的后训练特征:通过对深度预测模型(Depth Anything V2)在机器人领域 RGB-D 数据上进行后训练,获得 RGB 衍生的几何特征(GEP 特征),并在策略推理时使用这些编码器特征,而非原始深度图。
- 仿真与真实世界验证:在 LIBERO、SimplerEnv-Fractal 和真实世界 ALOHA 平台上广泛验证了 GeoAlign 的有效性,并通过消融实验证明了几何后训练和状态引导查询的贡献。
Card 04
方法描述
方法描述
- 两阶段训练流程:首先,用机器人领域的 RGB-D 数据对 Depth Anything V2 模型进行后训练,然后丢弃深度预测头,保留编码器作为几何特征提取器(GEP 特征)。然后,在策略训练阶段冻结该几何编码器,训练其后的投影器、对齐模块和动作解码器。
- 状态引导的空间对齐:机器人的本体感知状态经编码和 MLP 映射后,生成 8 个可学习的查询向量。这些查询向量通过交叉注意力机制,从图像空间的 GEP 特征网格中动态提取与当前操作阶段相关的紧凑几何 Token。
- 动作生成:将提取的 8 个几何 Token 与视觉-语言模型(Isaac-GR00T N1.6-3B)输出的语义 Token 拼接,共同作为条件输入到基于流匹配的 DiT 动作解码头中,预测动作序列。
Card 05
数据集与资源
数据集与资源
- 训练数据:使用机器人演示数据(D_pol)训练策略,使用单独的机器人领域 RGB-D 数据(D_dep)离线后训练几何分支。
- 模型架构:基于 Isaac-GR00T N1.6-3B 的 VLA 模型,包含 Eagle-Block2A-2B VLM 特征和 32 层 DiT 动作解码头。几何分支基于 Depth Anything V2-Small,输出 5,476 个空间 Token(每视图)。
- 评估环境:LIBERO 基准(4 个套件,共 8000 次测试)、SimplerEnv-Fractal(3 个任务家族)和真实世界 AgileX ALOHA 平台(8 个任务)。
Card 06
评估与结果
评估与结果
- 仿真结果:在 LIBERO 上,GeoAlign 达到 99.0% 的平均成功率,尤其在空间推理要求高的套件上提升显著(Spatial 从 97.65% 到 100.0%)。在 SimplerEnv-Fractal 上,达到 85.3% 的平均成功率,比纯 RGB 基线高出 5.7 个百分点。
- 真实世界结果:在包含透明物体、环形物体等几何关键任务的真实环境 ALOHA 平台上,GeoAlign 达到 78.8% 的平均成功率,显著优于纯 RGB 基线(65.0%)和 π0.5 模型(67.5%)。
- 消融实验:移除机器人领域几何后训练(使用未适配的 DA-V2 特征)导致性能下降至 95.9%;用全局平均池化替代空间交叉注意力(w/o spatial querying)使性能降至 91.6%;用可学习查询替代本体状态查询(w/o state queries)使性能降至 96.2%,证实了各项设计的关键作用。