一眼看懂
封面预览
论文提出了 nuReasoning,一个专注于自动驾驶长尾场景推理的大规模真实世界数据集和基准。
- 论文提出了 nuReasoning,一个专注于自动驾驶长尾场景推理的大规模真实世界数据集和基准。
- 该研究旨在解决现有自动驾驶数据集主要关注感知和规划、缺乏针对长尾复杂场景推理监督的问题。
- 数据集包含 20,000 个驾驶片段,提供空间、决策和反事实推理标注,同时支持推理评估和规划评估,填补了推理型自动驾驶研究的空白。
Card 01
研究单位
研究单位
- University of California, Los Angeles
- Motional
Card 02
论文概述
论文概述
- 论文提出了 nuReasoning,一个专注于自动驾驶长尾场景推理的大规模真实世界数据集和基准。
- 该研究旨在解决现有自动驾驶数据集主要关注感知和规划、缺乏针对长尾复杂场景推理监督的问题。
- 数据集包含 20,000 个驾驶片段,提供空间、决策和反事实推理标注,同时支持推理评估和规划评估,填补了推理型自动驾驶研究的空白。
Card 03
核心贡献
核心贡献
- 构建了 nuReasoning 数据集,这是首个大规模真实世界自动驾驶长尾数据集,包含全面的空间、决策和反事实推理标注。
- 提出了 nuReasoning Benchmark,提供了统一的测试平台,用于同时评估视觉语言模型(VLM)的推理能力和视觉语言动作模型(VLA)的规划性能。
- 提出了 nuVLA 模型作为强有力的 VLA 基线,并通过实验证明推理监督能显著提升模型的问答准确率和轨迹规划性能。
Card 04
方法描述
方法描述
- 数据挖掘使用基于 Gemini 3.1 Pro 的 VLM 自动评估器筛选难度评分大于 5 的长尾场景,并结合人类专家验证关键帧。
- 推理标注分为三类:Spatial Reasoning(利用 VLM 检测和几何投影描述场景关系)、Decision Reasoning(生成包含场景描述、关键元素、决策和推理链的元动作)、Counterfactual Reasoning(分析替代动作的安全性)。
- 提出的 nuVLA 模型采用 Qwen3-VL-2B 作为视觉语言骨干网络,结合流匹配扩散 Transformer(DiT)作为动作头来生成未来轨迹。
Card 05
数据集与资源
数据集与资源
- 数据来源于 Motional 公司的自动驾驶车队日志,采集于拉斯维加斯、匹兹堡、洛杉矶和波士顿等多个城市。
- 数据集包含 20,000 个片段(约 105 小时),划分为 17K 训练集、2K 验证集和 1K 测试集。
- 标注包括 247K 空间推理帧和 57K 决策/反事实推理帧,生成了超过 167K 个用于训练的问答对。
- 模型训练使用 8 块 NVIDIA A100 GPU,采用 LoRA 微调策略。
Card 06
评估与结果
评估与结果
- 推理基准评估了 Geometry、Motion、Driving 和 Counterfactual 四项能力;使用 Qwen3-VL-8B 微调后,几何选择题准确率从 41.2% 提升至 92.0%,反事实推理准确率达到 81.6%,显著优于未微调的基线和 Gemini 模型。
- 规划基准使用 NuReasoning Planning Score (NPS) 评估,包含无过错碰撞、可行驶区域合规、行驶进度和舒适性等指标。
- nuVLA 模型在使用全部推理监督(Spatial + Decision + Counterfactual)训练后,取得了 73.09 的最高 NPS 分数和 1.555 的最低 ADE(平均位移误差),优于 UniAD 和 DiffusionDrive 等现有基线。