一眼看懂
封面预览
研究视觉-语言-动作(VLA)模型在机器人中的对抗性补丁攻击,聚焦于更实际的部分可观测威胁模型
- 研究视觉-语言-动作(VLA)模型在机器人中的对抗性补丁攻击,聚焦于更实际的部分可观测威胁模型
- 攻击者仅能利用执行轨迹的短前缀(前K帧) 来生成一个静态补丁,但该补丁需应用于所有后续帧并引发长期破坏效果
- 旨在揭示VLA机器人在有限观测条件下的实际安全漏洞,并推动更鲁棒模型的设计
Card 01
研究单位
研究单位
- 中国科学技术大学自动化系
- 广州大学网络空间先进技术研究院
- SmartMore Corporation
- 中国人民解放军总医院第八医学中心
- 合肥综合性国家科学中心人工智能研究院
Card 02
论文概述
论文概述
- 研究视觉-语言-动作(VLA)模型在机器人中的对抗性补丁攻击,聚焦于更实际的部分可观测威胁模型
- 攻击者仅能利用执行轨迹的短前缀(前K帧) 来生成一个静态补丁,但该补丁需应用于所有后续帧并引发长期破坏效果
- 旨在揭示VLA机器人在有限观测条件下的实际安全漏洞,并推动更鲁棒模型的设计
Card 03
核心贡献
核心贡献
- 首次形式化定义了完全可观测与部分可观测两种威胁模型,后者更贴近真实部署中的攻击约束
- 提出两阶段攻击框架:先利用注意力图定位补丁区域,再通过内容感知优化破坏感知与控制
- 设计语义接地破坏与轨迹平滑度破坏两种损失,分别扰乱指令-视觉对齐和诱导高曲率运动
- 在LIBERO基准和真实机器人上广泛验证,在部分可观测条件下显著降低任务成功率,优于现有方法
Card 04
方法描述
方法描述
- 基于注意力的补丁定位:利用VLA模型的交叉模态注意力图,在最后一个前缀帧上选择与指令最相关的紧凑区域放置补丁
- 内容感知补丁优化:
- 语义接地破坏:通过最大化目标名词对应注意力中心的位移,扰乱模型对物体的视觉定位
- 轨迹平滑度破坏:通过采样候选方向并选择曲率增幅最大的方向,引导动作偏离平滑路径
- 统一损失函数:\(\mathcal{L}_{adv} = \lambda_{sem}\mathcal{L}_{sem} + \lambda_{traj}\mathcal{L}_{traj}\),梯度更新受掩码限制
- 优化仅基于前缀 \(K\) 帧,但补丁固定应用于后续所有帧,评估在未见后缀上的攻击效果
Card 05
数据集与资源
数据集与资源
- 数据集:LIBERO 基准,包含 Spatial、Object、Goal、Long 四个任务套件,每套件10个任务,每任务100次试验,最大步数分别为220、280、300、520
- 受害者模型:OpenVLA 的四个变体(每套件训练一个)和 Hume 模型(不同架构验证)
- 训练资源:工作站配备 8块 H100 GPU,优化器 SGD,指数学习率衰减,默认前缀长度 \(K=40\),补丁大小 \(42\times42\) 像素
Card 06
评估与结果
评估与结果
- 评估指标:ASR(攻击成功率,任务失败的比例)和 nASR(归一化攻击成功率,还考虑任务延迟)
- 对比基线:UADA、UPA、TMA(源自先前工作,使用相同前缀长度和迭代次数)
- 主要结果:
- 在几乎所有前缀长度和任务套件下,本方法均取得最高 ASR 和 nASR,尤其在 \(K=30\) 时优势显著
- 在 Object 套件上 \(K=10\) 时即达到 83.2% ASR,Long 套件上 \(K=40\) 时达到 89.1% ASR
- 消融实验表明注意力定位和两种损失均对攻击效果有贡献,默认权重 \((\lambda_{sem},\lambda_{traj})=(1,12)\) 表现最佳
- 轨迹可视化显示攻击导致机器人偏离标称路径,产生振荡、超调并陷入高曲率区域,导致任务失败或严重延迟
- 物理攻击评估和不同防御手段的鲁棒性分析进一步验证了方法的有效性