论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。
- 论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。
- 提出了Reasoning-VLA,一个高效的VLA框架,通过可学习的动作查询与推理增强的视觉-语言表示交互,实现单步并行动作生成。
- 通过从真实轨迹中进行高斯分布采样来初始化可学习的动作查询,提升了模型效率。
研究单位
Lanzhou University, China
National University of Singapore, Singapore
University of Science and Technology of China, China
Tsinghua University, China
University of New South Wales, Australia
论文概述
论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。
核心贡献
- 提出了Reasoning-VLA,一个高效的VLA框架,通过可学习的动作查询与推理增强的视觉-语言表示交互,实现单步并行动作生成。
- 通过从真实轨迹中进行高斯分布采样来初始化可学习的动作查询,提升了模型效率。
- 构建了一个统一的、基于思维链推理的自动驾驶数据集,该数据集融合了八个现有数据集,以促进模型在不同车辆类型和驾驶环境下的泛化能力。
- 采用结合SFT和RL的微调策略,并辅以物理和动力学奖励函数,增强了模型的通用推理能力,显著优于先前的方法。
方法描述
该方法基于Qwen2.5-VL模型构建,包含三个主要部分:
- 推理增强的视觉-语言模型主干:利用Qwen2.5-VL作为基础模型,提供强大的视觉-语言理解和推理能力。
- VL到Action模块:引入一组可学习的动作查询,这些查询通过自注意力和与VLM特征的交叉注意力进行交互,从VLM的推理内容中提取动作相关信息,实现并行动作轨迹的预测。
- 动作细化模块(ARM):通过多层感知机(MLP)和注意力机制处理动作查询的隐藏状态,以细化特征表示,提高轨迹精度。
训练过程分为两个阶段:
- 监督微调(SFT):使用统一的推理数据集对模型进行初步训练,建立结构化的推理链。
- 强化学习(RL)微调:采用GRPO算法和设计的基于规则的奖励函数进行优化,以提高模型在未见场景下的泛化能力。奖励函数包括物理轨迹奖励、车辆动态奖励(转向和加速度约束)以及它们的加权和。
数据集与资源
数据集:
构建了一个统一的自动驾驶数据集,整合了八个公开数据集:NAVSIM, nuScenes, Waymo, Argoverse-V2, KITTI, Mapillary, ONCE, 和 IDD。经过筛选和处理,包含了超过75,000个高质量片段,并生成了思维链描述。
训练资源:
训练在8张H200 GPU上进行,总批大小为8。SFT阶段训练4个周期,学习率从5e-4开始;RL阶段训练1个周期,学习率从1e-6开始。累积梯度步数为2。
评估与结果
评估环境:
- 开环评估:在nuScenes数据集的验证集上进行,与现有方法进行公平比较。
- 闭环评估:在NeuroNCAP模拟器上进行,该模拟器能够模拟复杂的现实世界驾驶场景。
评估指标:
- 开环指标:
- L2误差(米):在1秒、2秒、3秒未来时间点的平均L2距离,值越低越好。
- 碰撞率(%):在1秒、2秒、3秒未来时间点的碰撞率,值越低越好。
- 闭环指标:
- NeuroNCAP分数:在静止、正面、侧面等不同场景下的得分,值越高越好。
- 碰撞率(%):在静止、正面、侧面等不同场景下的碰撞率,值越低越好。