Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。
- Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。
- 感知增强的世界Token:首次通过World-PV和World-BEV token在单一VLM中统一2D/3D感知,编码度量坐标和校准置信度。
- 网格条件密集感知:引入网格条件预测头,结合IoU感知评分和平行AR解码,显著提升长尾、远距离和小物体感知的准确性和稳定性。
研究单位
Yinwang Intelligent Technology Co. Ltd., Fudan University
论文概述
Percept-WAM是一种感知增强的世界-意识-动作模型,首次在单个视觉语言模型中隐式集成2D/3D场景理解能力。该模型通过World-PV和World-BEV token统一2D和3D感知任务,编码空间坐标和置信度。采用网格条件预测机制、IoU感知评分和平行自回归解码,提升长尾场景的稳定性。模型保留预训练VLM的通用智能能力,可直接输出感知结果和轨迹控制。实验表明Percept-WAM在下游感知基准匹配或超越经典检测器,并在nuScenes和NAVSIM上提升规划性能。
核心贡献
- 感知增强的世界Token:首次通过World-PV和World-BEV token在单一VLM中统一2D/3D感知,编码度量坐标和校准置信度。
- 网格条件密集感知:引入网格条件预测头,结合IoU感知评分和平行AR解码,显著提升长尾、远距离和小物体感知的准确性和稳定性。
- 感知到动作范式:在nuScenes和NAVSIM上超越专业检测/分割基线,通过World-PV、World-BEV和World-Action token的对齐实现卓越规划性能。
方法描述
Percept-WAM包含三部分:1) VLM主干(InternVL2-8B)维持通用推理能力;2) 可学习BEV网格token隐式建模PV特征到BEV空间的映射;3) 动作专家头用于轨迹解码。World-PV分支处理透视视图感知,支持高分辨率输入和平行AR解码,输出序列格式为cls,
数据集与资源
数据集:nuImages(2D检测/实例分割/语义分割)、nuScenes(3D检测/BEV分割/轨迹预测)、COCO(2D检测/实例分割/语义分割)、Waymo(3D检测)、RefCOCO系列(定位)、ADE20K(语义分割)、COCOStuff(语义分割)、NAVSIM(轨迹预测)、DriveLM-nuscenes(QA)等。训练使用AdamW优化器(基础学习率0.0002,权重衰减0.01),余弦衰减学习率,混合精度训练,梯度检查点。World-PV采用10×10网格,World-BEV检测使用40×40网格。
评估与结果
评估环境:nuScenes验证集(PV/BEV感知任务)、NAVSIM v1(闭环规划)、nuScenes开放环路指标(轨迹L2误差)。评估指标:2D/3D检测mAP、NDS(nuScenes检测分数)、实例分割mAP、语义分割mIoU、轨迹L2误差(1s/2s/3s)、NAVSIM闭环指标(NC碰撞率、DAC动态舒适度、TTC时间至碰撞、Comf舒适性、EP效率、PDMS规划得分)、帧延迟(ms)。