本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。
- 本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。
- 双层次重要性标准:同时考虑视觉-语言预填充注意力(语义级相关性)和动作解码注意力(动作级重要性)。
- 时间平滑机制:利用动作解码注意力的时间连续性,通过衰减窗口平均估计当前动作注意力。
研究单位
上海交通大学人工智能学院、中国科学技术大学、哈尔滨工业大学(深圳)、北京智源人工智能研究院(BAAI)
论文概述
本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。
核心贡献
- 双层次重要性标准:同时考虑视觉-语言预填充注意力(语义级相关性)和动作解码注意力(动作级重要性)。
- 时间平滑机制:利用动作解码注意力的时间连续性,通过衰减窗口平均估计当前动作注意力。
- 双层次令牌选择策略:基于最小冗余最大相关性(mRMR)原则,通过相关性最大化合并和冗余最小化过滤,自适应保留信息量高且多样化的视觉令牌。
- 即插即用设计:无需重新训练,兼容主流VLA架构(如OpenVLA、π₀等)。
方法描述
- 双层次重要性评估:
- 语义级重要性:使用视觉-语言预填充阶段的注意力分数(公式2)。
- 动作级重要性:通过时间平滑(指数衰减窗口平均)估计动作解码注意力(公式7)。
- 令牌选择流程:
- 双层次Top-k选择:分别获取语义和动作级重要令牌子集。
- 相关性最大化合并:取两个子集的并集作为候选池。
- 冗余最小化过滤:求解最大-最小多样性问题(公式8),通过贪心算法基于余弦距离(公式9)选择最终令牌子集。
- 实现细节:在第3层Transformer层剪枝;窗口大小w=3,衰减率γ=0.8;warm-up w步以收集动作注意力历史。
数据集与资源
- 数据集:
- LIBERO:模拟机器人操作任务套件。
- SIMPLER:多场景机器人评估基准。
- 真实机器人数据:6-DoF xArm6机器人部署数据。
- 训练资源:
- 免训练方法,无需额外训练数据或资源。
- 依赖历史动作注意力进行在线估计,warm-up阶段需w=3步。
评估与结果
- 评估环境:
- 模拟环境:LIBERO和SIMPLER基准测试。
- 真实环境:xArm6物理机器人。
- 评估指标:
- 任务成功率(Success Rate, %):LIBERO的Spatial/Object/Goal/Long任务平均值。
- 计算效率:
- FLOPs(T):浮点运算量。
- 推理延迟(ms/action或ms/action-chunk)。
- 加速比(Speedup, ×):相对于未剪枝模型的推理速度倍率。