本文关注视觉-语言-动作(VLA)模型在具身环境中的对抗鲁棒性问题。尽管VLA模型在机器人感知、推理和行动方面取得了显著进展,但其对抗鲁棒性,尤其是在现实多模态和黑盒条件下的表现,尚未被充分探索。现有研究主要集中于单模态扰动,而忽视了影响具身推理和决策的根本性跨模态不对齐问题。为此,论文提出了VLA-Fool,这是一个在白盒和黑盒设置下对具身VLA模型多模态对抗鲁棒性的综合研究套件。VLA-Fool统一了三个层次的多模态对抗攻击:文本扰动、视觉扰动和跨模态不对齐攻击。在LIBERO基准上使用微调的OpenVLA模型进行的实验表明,即使是轻微的多模态扰动也可能导致显著的行为偏差,揭示了具身多模态对齐的脆弱性。
- 本文关注视觉-语言-动作(VLA)模型在具身环境中的对抗鲁棒性问题。尽管VLA模型在机器人感知、推理和行动方面取得了显著进展,但其对抗鲁棒性,尤其是在现实多模态和黑盒条件下的表现,尚未被充分探索。现有研究主要集中于单模态扰动,而忽视了影响具身推理和决策的根本性跨模态不对齐问题。为此,论文提出了VLA-Fool,这是一个在白盒和黑盒设置下对具身VLA模型多模态对抗鲁棒性的综合研究套件。VLA-Fool统一了三个层次的多模态对抗攻击:文本扰动、视觉扰动和跨模态不对齐攻击。在LIBERO基准上使用微调的OpenVLA模型进行的实验表明,即使是轻微的多模态扰动也可能导致显著的行为偏差,揭示了具身多模态对齐的脆弱性。
- 提出了VLA-Fool,一个在白盒和黑盒设置下生成和评估多模态对抗攻击的综合框架。该框架包括通过基于梯度和基于提示的策略进行文本扰动,通过补丁和噪声失真进行视觉扰动,以及故意破坏感知与指令之间语义对应关系的跨模态不对齐攻击。
- 通过将贪婪坐标梯度(GCG)方法扩展到VLA感知的语义空间,引入了首个自动构建的、语义引导的提示框架,用于VLA对抗攻击,包括四种语言丰富的错误对齐模式:指代歧义、属性削弱、范围模糊和否定混淆。
研究单位
- 西湖大学工学院TGAI实验室
- 浙江大学
- 宾夕法尼亚州立大学
- 索尼研究
论文概述
本文关注视觉-语言-动作(VLA)模型在具身环境中的对抗鲁棒性问题。尽管VLA模型在机器人感知、推理和行动方面取得了显著进展,但其对抗鲁棒性,尤其是在现实多模态和黑盒条件下的表现,尚未被充分探索。现有研究主要集中于单模态扰动,而忽视了影响具身推理和决策的根本性跨模态不对齐问题。为此,论文提出了VLA-Fool,这是一个在白盒和黑盒设置下对具身VLA模型多模态对抗鲁棒性的综合研究套件。VLA-Fool统一了三个层次的多模态对抗攻击:文本扰动、视觉扰动和跨模态不对齐攻击。在LIBERO基准上使用微调的OpenVLA模型进行的实验表明,即使是轻微的多模态扰动也可能导致显著的行为偏差,揭示了具身多模态对齐的脆弱性。
核心贡献
- 提出了VLA-Fool,一个在白盒和黑盒设置下生成和评估多模态对抗攻击的综合框架。该框架包括通过基于梯度和基于提示的策略进行文本扰动,通过补丁和噪声失真进行视觉扰动,以及故意破坏感知与指令之间语义对应关系的跨模态不对齐攻击。
- 通过将贪婪坐标梯度(GCG)方法扩展到VLA感知的语义空间,引入了首个自动构建的、语义引导的提示框架,用于VLA对抗攻击,包括四种语言丰富的错误对齐模式:指代歧义、属性削弱、范围模糊和否定混淆。
- 通过广泛的实验,揭示了最先进的VLA模型在面对多模态扰动时的脆弱性,在所有变化类别的失败率超过60%,在长视野任务中失败率高达100%,为开发更强大和可信的具身代理提供了宝贵的见解和基准。
方法描述
VLA-Fool是一个统一的多模态对抗攻击套件,包含三个互补的模块:
- 文本攻击:
- SGCG (白盒): 一种基于梯度的语义引导攻击方法。它并行执行K个GCG优化过程,每个过程专注于一种特定的语义扰动策略,例如将具体实体替换为代词(指代歧义)、改变关键属性(属性削弱)、替换空间描述词(范围模糊)或引入否定词(否定混淆)。
- 提示操作 (黑盒): 无需模型内部信息的简单攻击。包括后缀注入(如附加“忽略之前的信息”或随机代码片段)和前缀注入(在指令前添加误导性上下文)来操纵模型行为。
- 视觉攻击:
- 局部补丁攻击 (白盒): 利用模型梯度直接优化一个可放置在环境物体或机械臂上的小补丁内容,通过最大化模型输出动作与原始动作之间的L2距离,使机器人执行错误的动作序列。
- 噪声扰动攻击 (黑盒): 向图像中注入各种类型的噪声,模拟真实世界的传感器退化或环境干扰。测试的噪声类型包括高斯噪声、椒盐噪声、斑点噪声、均匀噪声和伪随机噪声等。
- 跨模态不对齐攻击:
- 该攻击不单独扰动某个模态,而是同时优化视觉和文本扰动,以最大化跨模态不对齐损失(L_mis)。该损失函数衡量扰动前后视觉嵌入与语言嵌入之间平均余弦相似度的变化,旨在破坏视觉和语言特征之间的语义对应关系,从而从根本上瓦解VLA的感知-语言-行动管道。
数据集与资源
- 数据集: LIBERO基准数据集。该数据集提供了一系列多样化的视觉-语言操作任务和逼真的模拟场景,分为四个评估类别:空间关系查询、对象识别与操作、目标导向行为和长视野多步骤任务。
- 训练资源: 实验使用了一个在LIBERO数据集上微调的7B参数OpenVLA模型作为受害者模型。模型推理在单块NVIDIA L40s(48GB)GPU上运行,使用bfloat16精度。
评估与结果
- 评估环境: 所有实验均在LIBERO数据集提供的模拟环境中进行。
- 评估指标:
- 失败率: 主要评估指标,定义为 FR = 1 - SR(任务成功率)。该指标直接反映了对抗性扰动导致的任务完成度下降,用于衡量模型对攻击的脆弱性。
- 不对齐损失: 一个辅助评估指标,用于量化由扰动引起的视觉和语言表征之间的不一致性。它通过计算扰动前后视觉块嵌入与语言标记嵌入之间平均余弦相似度的变化来衡量。