论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。
- 论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。
- 提出了新颖的AVA-VLA框架,通过受POMDP启发的方法,首次显式地解决了基于MDP的VLA模型中缺乏历史上下文的关键限制。
- 引入了主动视觉注意模块,利用循环状态来动态调制当前帧的视觉处理,以进行动作预测。
研究单位
LiAuto Inc., School of Information Science and Technology, Beijing University of Technology, School of Data Science, The Chinese University of Hong Kong, Shenzhen
论文概述
论文指出现有的视觉-语言-行动模型通常基于视觉-语言模型,将每个时间步的视觉输入作为独立帧处理,这种隐式的马尔可夫决策过程建模未能有效利用历史上下文,在动态的序列决策中是次优的。为解决此问题,论文从部分可观察马尔可夫决策过程的视角重新构建了问题,提出了AVA-VLA框架。该框架引入一个循环状态作为代理信念状态的神经网络近似,并设计了主动视觉注意模块,利用该循环状态动态调制当前帧的视觉处理,使模型能基于历史上下文主动过滤无关信息并聚焦于任务关键特征。
核心贡献
- 提出了新颖的AVA-VLA框架,通过受POMDP启发的方法,首次显式地解决了基于MDP的VLA模型中缺乏历史上下文的关键限制。
- 引入了主动视觉注意模块,利用循环状态来动态调制当前帧的视觉处理,以进行动作预测。
- 在模拟和真实世界任务中进行了全面评估,证明了AVA-VLA框架提升了VLA性能,并在多个机器人任务上取得了最先进的结果。
方法描述
AVA-VLA框架包含三个核心部分:
- 问题重构建:将机器人操作任务从MDP重构建为POMDP。引入一个循环状态 r^{t-1} 作为代理信念状态的神经近似,该状态由上一时间步 t-1 的模型中间输出计算得出。策略预测不仅基于当前观测 x^t,还显式地基于循环状态 r^{t-1}。
- 主动视觉注意模块:该模块接收当前观测和循环状态,通过交叉注意力机制和自注意力层,计算视觉标记的软权重 ω^t。这些权重被应用于语言模型主干所有层的注意力矩阵,动态增强或减弱不同视觉标记的重要性,使模型能根据历史信念主动聚焦于任务相关区域。
- 训练与推理:训练采用截断的反向传播时间策略,以平衡计算可行性。损失函数包括动作块的平均绝对误差损失和对软权重均值的L2正则化惩罚。推理时,模型以完全循环的方式运行,在每个时间步更新循环状态。
数据集与资源
- 数据集:
- LIBERO 和 LIBERO+ 基准
- CALVIN 基准(ABC到D的零样本泛化设置)
- 真实世界任务:基于Mobile ALOHA双臂机器人的四个操作任务
- 训练资源:
- 基础模型:OpenVLA-OFT
- 计算平台:Nvidia A800 GPU
评估与结果
- 评估环境:
- 模拟环境:LIBERO(MuJoCo模拟器)和CALVIN的模拟环境。
- 真实环境:一个桌置式双臂机器人平台。
- 评估指标:
- 成功率:用于LIBERO、CALVIN和真实世界任务的主要评估指标。
- 平均长度:用于CALVIN基准的补充指标,衡量任务完成的平均长度。