本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。
- 本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。
- 提出了首个能够将罕见场景处理能力从模拟转移到真实世界的VLM自动驾驶模型。
- 引入了一种新颖的判别器,用于学习模拟与真实世界数据之间的域差异。
研究单位
兰州大学、新加坡国立大学、中国科学技术大学
论文概述
本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。
核心贡献
- 提出了首个能够将罕见场景处理能力从模拟转移到真实世界的VLM自动驾驶模型。
- 引入了一种新颖的判别器,用于学习模拟与真实世界数据之间的域差异。
- 提出了一种反向传播策略,增强了对抗训练过程的收敛稳定性。
- 开发了因果链策略,将时序信息与因果链答案连接,支持思维链推理以建模深层驾驶逻辑。
- 在nuScenes-VLM数据集上进行了广泛实验,表明该方法显著优于现有方法。
方法描述
方法包括三个核心组件:教师VLM、学生VLM和判别器。
- 因果链视觉语言模型(CoC VLM):作为教师和学生模型的共享基础架构,包含文本适配器(整合历史帧的简化答案与当前指令)、视觉适配器(将多视图图像转换为令牌)、LLM大脑(基于LLaMA)和因果链答案模块(生成感知、预测和规划的因果结构答案)。
- 判别器:采用Transformer架构,处理来自教师和学生VLM的特征,通过对抗学习对齐特征表示,最小化域差异。
- 训练流程:
- 预训练:教师模型在模拟数据(CARLA-VLM)上训练,学生模型在真实数据(nuScenes-VLM)上训练。
- 对抗训练:
- 步骤1:使用模拟和真实数据前向传播,仅更新判别器参数。
- 步骤2:使用真实数据前向传播学生VLM和判别器,结合VLM损失和判别器损失更新学生VLM,判别器参数不更新。
数据集与资源
数据集:
- CARLA-VLM:模拟数据集,包含61.6%常规场景和38.4%挑战性场景(如交通堵塞、行人入侵等)。
- nuScenes-VLM:基于nuScenes的真实世界数据集,用于预训练学生模型和最终评估。
训练资源:使用8块NVIDIA H100 GPU,采用LoRA方法微调模型以降低计算资源需求。
评估与结果
评估环境:基于nuScenes-VLM数据集进行开环评估。
评估指标:
语言评估指标:
- BLEU-1至BLEU-4:衡量预测文本与参考文本的n元语法匹配度。
- ROUGE-L:基于最长公共子序列的召回率评估。
- CIDEr:通过TF-IDF向量余弦距离衡量文本相似性。
- SPICE:基于场景图的结构相似性评估。
- GPT Score:利用ChatGPT评估语义对齐度。
- Accuracy和Match:衡量答案正确性。
规划评估指标:
- 平均位移误差(ADE):预测轨迹与真实轨迹之间的平均L2距离。
- 碰撞率(Collision Rate):评估帧中发生碰撞的比例。