返回列表
VLA / Vision-Language-Action 每日论文卡
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。

论文详情

Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

2025-11-24 · 原文 · 翻译 · 2511.19221

Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。

5 分钟读完 6 张阅读卡 Yinwang Intelligent Technology Co.
一眼看懂 封面预览

Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。

  • Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。
  • 感知增强的世界Token:首次通过World-PV和World-BEV token在单一VLM中统一2D/3D感知,编码度量坐标和校准置信度。
  • 网格条件密集感知:引入网格条件预测头,结合IoU感知评分和平行AR解码,显著提升长尾、远距离和小物体感知的准确性和稳定性。
Card 01 研究单位

研究单位

Yinwang Intelligent Technology Co. Ltd., Fudan University

Card 02 论文概述

论文概述

Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。

Card 03 核心贡献

核心贡献

  1. 感知增强的世界Token:首次通过World-PV和World-BEV token在单一VLM中统一2D/3D感知,编码度量坐标和校准置信度。
  2. 网格条件密集感知:引入网格条件预测头,结合IoU感知评分和平行AR解码,显著提升长尾、远距离和小物体感知的准确性和稳定性。
  3. 感知到动作范式:在nuScenes和NAVSIM上超越专业检测/分割基线,通过World-PV、World-BEV和World-Action token的对齐实现卓越规划性能。
Card 04 方法描述

方法描述

Percept-WAM包含三部分:1) VLM主干(InternVL2-8B)维持通用推理能力;2) 可学习BEV网格token隐式建模PV特征到BEV空间的映射;3) 动作专家头用于轨迹解码。World-PV分支处理透视视图感知,支持高分辨率输入和平行AR解码,输出序列格式为cls, 坐标, 置信度。World-BEV分支通过可学习查询token实现BEV空间感知,支持多模态融合。动作模块通过四组点级查询(Q_pv, Q_bev, Q_ego, Q_full)对齐多模态信息,使用MLP解码轨迹,并采用流式KV缓存策略提升效率。

Card 05 数据集与资源

数据集与资源

数据集:nuImages(2D检测/实例分割/语义分割)、nuScenes(3D检测/BEV分割/轨迹预测)、COCO(2D检测/实例分割/语义分割)、Waymo(3D检测)、RefCOCO系列(定位)、ADE20K(语义分割)、COCOStuff(语义分割)、NAVSIM(轨迹预测)、DriveLM-nuscenes(QA)等。训练使用AdamW优化器(基础学习率0.0002,权重衰减0.01),余弦衰减学习率,混合精度训练,梯度检查点。World-PV采用10×10网格,World-BEV检测使用40×40网格。

Card 06 评估与结果

评估与结果

评估环境:nuScenes验证集(PV/BEV感知任务)、NAVSIM v1(闭环规划)、nuScenes开放环路指标(轨迹L2误差)。评估指标:2D/3D检测mAP、NDS(nuScenes检测分数)、实例分割mAP、语义分割mIoU、轨迹L2误差(1s/2s/3s)、NAVSIM闭环指标(NC碰撞率、DAC动态舒适度、TTC时间至碰撞、Comf舒适性、EP效率、PDMS规划得分)、帧延迟(ms)。