返回列表
VLA / Vision-Language-Action 每日论文卡
VLA-Pruner: Temporal-Aware Dual-Level Visual Token Pruning for Efficient Vision-Language-Action Inference
本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。

论文详情

VLA-Pruner: Temporal-Aware Dual-Level Visual Token Pruning for Efficient Vision-Language-Action Inference

2025-11-20 · 原文 · 翻译 · 2511.16449

本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。

4 分钟读完 6 张阅读卡 上海交通大学人工智能学院、中国科学技术大学、哈尔滨工业大学(深圳)、北京智源人工智能研究院(BAAI)
一眼看懂 封面预览

本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。

  • 本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。
  • 双层次重要性标准:同时考虑视觉-语言预填充注意力(语义级相关性)和动作解码注意力(动作级重要性)。
  • 时间平滑机制:利用动作解码注意力的时间连续性,通过衰减窗口平均估计当前动作注意力。
Card 01 研究单位

研究单位

上海交通大学人工智能学院、中国科学技术大学、哈尔滨工业大学(深圳)、北京智源人工智能研究院(BAAI)

Card 02 论文概述

论文概述

本文针对视觉-语言-动作(VLA)模型在处理连续视觉流时计算开销大的问题,提出了一种名为VLA-Pruner的免训练、即插即用的视觉令牌剪枝方法。该方法结合了VLA模型的双系统特性(高层语义理解与底层动作执行),并利用机器人操作中的时间连续性,实现了高效推理。实验表明,在多个VLA架构和机器人任务上,该方法在保持精度的同时显著提升了计算效率。

Card 03 核心贡献

核心贡献

  1. 双层次重要性标准:同时考虑视觉-语言预填充注意力(语义级相关性)和动作解码注意力(动作级重要性)。
  2. 时间平滑机制:利用动作解码注意力的时间连续性,通过衰减窗口平均估计当前动作注意力。
  3. 双层次令牌选择策略:基于最小冗余最大相关性(mRMR)原则,通过相关性最大化合并和冗余最小化过滤,自适应保留信息量高且多样化的视觉令牌。
  4. 即插即用设计:无需重新训练,兼容主流VLA架构(如OpenVLA、π₀等)。
Card 04 方法描述

方法描述

  1. 双层次重要性评估

- 语义级重要性:使用视觉-语言预填充阶段的注意力分数(公式2)。

- 动作级重要性:通过时间平滑(指数衰减窗口平均)估计动作解码注意力(公式7)。

  1. 令牌选择流程

- 双层次Top-k选择:分别获取语义和动作级重要令牌子集。

- 相关性最大化合并:取两个子集的并集作为候选池。

- 冗余最小化过滤:求解最大-最小多样性问题(公式8),通过贪心算法基于余弦距离(公式9)选择最终令牌子集。

  1. 实现细节:在第3层Transformer层剪枝;窗口大小w=3,衰减率γ=0.8;warm-up w步以收集动作注意力历史。
Card 05 数据集与资源

数据集与资源

  • 数据集

- LIBERO:模拟机器人操作任务套件。

- SIMPLER:多场景机器人评估基准。

- 真实机器人数据:6-DoF xArm6机器人部署数据。

  • 训练资源

- 免训练方法,无需额外训练数据或资源。

- 依赖历史动作注意力进行在线估计,warm-up阶段需w=3步。

Card 06 评估与结果

评估与结果

  • 评估环境

- 模拟环境:LIBERO和SIMPLER基准测试。

- 真实环境:xArm6物理机器人。

  • 评估指标

- 任务成功率(Success Rate, %):LIBERO的Spatial/Object/Goal/Long任务平均值。

- 计算效率:

- FLOPs(T):浮点运算量。

- 推理延迟(ms/action或ms/action-chunk)。

- 加速比(Speedup, ×):相对于未剪枝模型的推理速度倍率。