返回列表
VLA / Vision-Language-Action 每日论文卡
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。

论文详情

AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

2025-11-24 · 原文 · 翻译 · 2511.18960

论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。

5 分钟读完 6 张阅读卡 LiAuto Inc., School of Information Science and Tech…
一眼看懂 封面预览

论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。

  • 论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。
  • 提出了新颖的AVA-VLA框架,通过受POMDP启发的方法,首次显式地解决了基于MDP的VLA模型中缺乏历史上下文的关键限制。
  • 引入了主动视觉注意模块,利用循环状态来动态调制当前帧的视觉处理,以进行动作预测。
Card 01 研究单位

研究单位

LiAuto Inc., School of Information Science and Technology, Beijing University of Technology, School of Data Science, The Chinese University of Hong Kong, Shenzhen

Card 02 论文概述

论文概述

论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。

Card 03 核心贡献

核心贡献

  1. 提出了新颖的AVA-VLA框架,通过受POMDP启发的方法,首次显式地解决了基于MDP的VLA模型中缺乏历史上下文的关键限制。
  2. 引入了主动视觉注意模块,利用循环状态来动态调制当前帧的视觉处理,以进行动作预测。
  3. 在模拟和真实世界任务中进行了全面评估,证明了AVA-VLA框架提升了VLA性能,并在多个机器人任务上取得了最先进的结果。
Card 04 方法描述

方法描述

AVA-VLA框架包含三个核心部分:

  1. 问题重构建:将机器人操作任务从MDP重构建为POMDP。引入一个循环状态 r^{t-1} 作为代理信念状态的神经近似,该状态由上一时间步 t-1 的模型中间输出计算得出。策略预测不仅基于当前观测 x^t,还显式地基于循环状态 r^{t-1}。
  2. 主动视觉注意模块:该模块接收当前观测和循环状态,通过交叉注意力机制和自注意力层,计算视觉标记的软权重 ω^t。这些权重被应用于语言模型主干所有层的注意力矩阵,动态增强或减弱不同视觉标记的重要性,使模型能根据历史信念主动聚焦于任务相关区域。
  3. 训练与推理:训练采用截断的反向传播时间策略,以平衡计算可行性。损失函数包括动作块的平均绝对误差损失和对软权重均值的L2正则化惩罚。推理时,模型以完全循环的方式运行,在每个时间步更新循环状态。
Card 05 数据集与资源

数据集与资源

  • 数据集

- LIBERO 和 LIBERO+ 基准

- CALVIN 基准(ABC到D的零样本泛化设置)

- 真实世界任务:基于Mobile ALOHA双臂机器人的四个操作任务

  • 训练资源

- 基础模型:OpenVLA-OFT

- 计算平台:Nvidia A800 GPU

Card 06 评估与结果

评估与结果

  • 评估环境

- 模拟环境:LIBERO(MuJoCo模拟器)和CALVIN的模拟环境。

- 真实环境:一个桌置式双臂机器人平台。

  • 评估指标

- 成功率:用于LIBERO、CALVIN和真实世界任务的主要评估指标。

- 平均长度:用于CALVIN基准的补充指标,衡量任务完成的平均长度。