返回列表
VLA / Vision-Language-Action 每日论文卡
CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。

论文详情

CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model

2025-11-25 · 原文 · 翻译 · 2511.19914

本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。

5 分钟读完 6 张阅读卡 兰州大学、新加坡国立大学、中国科学技术大学
一眼看懂 封面预览

本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。

  • 本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。
  • 提出了首个能够将罕见场景处理能力从模拟转移到真实世界的VLM自动驾驶模型。
  • 引入了一种新颖的判别器,用于学习模拟与真实世界数据之间的域差异。
Card 01 研究单位

研究单位

兰州大学、新加坡国立大学、中国科学技术大学

Card 02 论文概述

论文概述

本文提出了一种名为CoC-VLA的新型视觉-语言-动作模型,旨在通过对抗性域转移实现可解释的自动驾驶。该模型包含教师VLM模型、学生VLM模型和一个判别器。教师模型在模拟数据上预训练,学生模型在真实世界数据上预训练,两者共享相同的因果链(Chain-of-Causality)VLM架构。通过判别器进行对抗训练,将模拟数据中的长尾场景处理能力转移到真实世界部署中,从而弥合了模拟与真实世界自动驾驶之间的差距。

Card 03 核心贡献

核心贡献

  • 提出了首个能够将罕见场景处理能力从模拟转移到真实世界的VLM自动驾驶模型。
  • 引入了一种新颖的判别器,用于学习模拟与真实世界数据之间的域差异。
  • 提出了一种反向传播策略,增强了对抗训练过程的收敛稳定性。
  • 开发了因果链策略,将时序信息与因果链答案连接,支持思维链推理以建模深层驾驶逻辑。
  • 在nuScenes-VLM数据集上进行了广泛实验,表明该方法显著优于现有方法。
Card 04 方法描述

方法描述

方法包括三个核心组件:教师VLM、学生VLM和判别器。

  1. 因果链视觉语言模型(CoC VLM):作为教师和学生模型的共享基础架构,包含文本适配器(整合历史帧的简化答案与当前指令)、视觉适配器(将多视图图像转换为令牌)、LLM大脑(基于LLaMA)和因果链答案模块(生成感知、预测和规划的因果结构答案)。
  2. 判别器:采用Transformer架构,处理来自教师和学生VLM的特征,通过对抗学习对齐特征表示,最小化域差异。
  3. 训练流程:

- 预训练:教师模型在模拟数据(CARLA-VLM)上训练,学生模型在真实数据(nuScenes-VLM)上训练。

- 对抗训练:

- 步骤1:使用模拟和真实数据前向传播,仅更新判别器参数。

- 步骤2:使用真实数据前向传播学生VLM和判别器,结合VLM损失和判别器损失更新学生VLM,判别器参数不更新。

Card 05 数据集与资源

数据集与资源

数据集:

  • CARLA-VLM:模拟数据集,包含61.6%常规场景和38.4%挑战性场景(如交通堵塞、行人入侵等)。
  • nuScenes-VLM:基于nuScenes的真实世界数据集,用于预训练学生模型和最终评估。

训练资源:使用8块NVIDIA H100 GPU,采用LoRA方法微调模型以降低计算资源需求。

Card 06 评估与结果

评估与结果

评估环境:基于nuScenes-VLM数据集进行开环评估。

评估指标:

语言评估指标:

  • BLEU-1至BLEU-4:衡量预测文本与参考文本的n元语法匹配度。
  • ROUGE-L:基于最长公共子序列的召回率评估。
  • CIDEr:通过TF-IDF向量余弦距离衡量文本相似性。
  • SPICE:基于场景图的结构相似性评估。
  • GPT Score:利用ChatGPT评估语义对齐度。
  • Accuracy和Match:衡量答案正确性。

规划评估指标:

  • 平均位移误差(ADE):预测轨迹与真实轨迹之间的平均L2距离。
  • 碰撞率(Collision Rate):评估帧中发生碰撞的比例。