返回列表
VLA / Vision-Language-Action 每日论文卡
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。

论文详情

Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving

2025-11-25 · 原文 · 翻译 · 2511.19912

论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。

6 分钟读完 6 张阅读卡 Lanzhou University, China National University of Si…
一眼看懂 封面预览

论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。

  • 论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。
  • 提出了Reasoning-VLA,一个高效的VLA框架,通过可学习的动作查询与推理增强的视觉-语言表示交互,实现单步并行动作生成。
  • 通过从真实轨迹中进行高斯分布采样来初始化可学习的动作查询,提升了模型效率。
Card 01 研究单位

研究单位

Lanzhou University, China

National University of Singapore, Singapore

University of Science and Technology of China, China

Tsinghua University, China

University of New South Wales, Australia

Card 02 论文概述

论文概述

论文提出了一种名为Reasoning-VLA的通用且快速的视觉-语言-动作(VLA)推理模型,用于解决现有自动驾驶VLA模型在推理效率和泛化能力方面的不足。该模型通过一组可学习的动作查询与增强推理的视觉-语言特征交互,实现连续动作轨迹的并行生成。为了提升泛化性,研究整合了八个公开的自动驾驶数据集,构建了一个基于思维链推理的统一数据集。结合监督微调(SFT)和强化学习(RL)的训练策略,实验表明Reasoning-VLA在多个基准上实现了最先进的性能、卓越的泛化能力和目前报告的优异推理速度。

Card 03 核心贡献

核心贡献

  1. 提出了Reasoning-VLA,一个高效的VLA框架,通过可学习的动作查询与推理增强的视觉-语言表示交互,实现单步并行动作生成。
  2. 通过从真实轨迹中进行高斯分布采样来初始化可学习的动作查询,提升了模型效率。
  3. 构建了一个统一的、基于思维链推理的自动驾驶数据集,该数据集融合了八个现有数据集,以促进模型在不同车辆类型和驾驶环境下的泛化能力。
  4. 采用结合SFT和RL的微调策略,并辅以物理和动力学奖励函数,增强了模型的通用推理能力,显著优于先前的方法。
Card 04 方法描述

方法描述

该方法基于Qwen2.5-VL模型构建,包含三个主要部分:

  1. 推理增强的视觉-语言模型主干:利用Qwen2.5-VL作为基础模型,提供强大的视觉-语言理解和推理能力。
  2. VL到Action模块:引入一组可学习的动作查询,这些查询通过自注意力和与VLM特征的交叉注意力进行交互,从VLM的推理内容中提取动作相关信息,实现并行动作轨迹的预测。
  3. 动作细化模块(ARM):通过多层感知机(MLP)和注意力机制处理动作查询的隐藏状态,以细化特征表示,提高轨迹精度。

训练过程分为两个阶段:

  1. 监督微调(SFT):使用统一的推理数据集对模型进行初步训练,建立结构化的推理链。
  2. 强化学习(RL)微调:采用GRPO算法和设计的基于规则的奖励函数进行优化,以提高模型在未见场景下的泛化能力。奖励函数包括物理轨迹奖励、车辆动态奖励(转向和加速度约束)以及它们的加权和。
Card 05 数据集与资源

数据集与资源

数据集

构建了一个统一的自动驾驶数据集,整合了八个公开数据集:NAVSIM, nuScenes, Waymo, Argoverse-V2, KITTI, Mapillary, ONCE, 和 IDD。经过筛选和处理,包含了超过75,000个高质量片段,并生成了思维链描述。

训练资源

训练在8张H200 GPU上进行,总批大小为8。SFT阶段训练4个周期,学习率从5e-4开始;RL阶段训练1个周期,学习率从1e-6开始。累积梯度步数为2。

Card 06 评估与结果

评估与结果

评估环境

  1. 开环评估:在nuScenes数据集的验证集上进行,与现有方法进行公平比较。
  2. 闭环评估:在NeuroNCAP模拟器上进行,该模拟器能够模拟复杂的现实世界驾驶场景。

评估指标

  1. 开环指标

- L2误差(米):在1秒、2秒、3秒未来时间点的平均L2距离,值越低越好。

- 碰撞率(%):在1秒、2秒、3秒未来时间点的碰撞率,值越低越好。

  1. 闭环指标

- NeuroNCAP分数:在静止、正面、侧面等不同场景下的得分,值越高越好。

- 碰撞率(%):在静止、正面、侧面等不同场景下的碰撞率,值越低越好。