返回列表
VLA / Vision-Language-Action 每日论文卡
AURA: Action-Gated Memory for Robot Policies at Constant VRAM
针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法

论文详情

AURA: Action-Gated Memory for Robot Policies at Constant VRAM

2026-06-01 · 原文 · 翻译 · 2606.02775

针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法 设计了一个固定大小的记忆模块,通过动作驱动的门控机制决定何时写入记忆,在保持任务性能的同时大幅减少内存写入次数 在合成基准测试上,实现了与最优 O(1) 基线相当的任务成功率,但写入次数减少 4.98–9.19 倍

6 分钟读完 6 张阅读卡 KAIKAKU(作者 Josef Chen 所属机构)
一眼看懂 封面预览

针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法

  • 针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法
  • 设计了一个固定大小的记忆模块,通过动作驱动的门控机制决定何时写入记忆,在保持任务性能的同时大幅减少内存写入次数
  • 在合成基准测试上,实现了与最优 O(1) 基线相当的任务成功率,但写入次数减少 4.98–9.19 倍
Card 01 研究单位

研究单位

  • KAIKAKU(作者 Josef Chen 所属机构)
Card 02 论文概述

论文概述

  • 针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法
  • 设计了一个固定大小的记忆模块,通过动作驱动的门控机制决定何时写入记忆,在保持任务性能的同时大幅减少内存写入次数
  • 在合成基准测试上,实现了与最优 O(1) 基线相当的任务成功率,但写入次数减少 4.98–9.19 倍
Card 03 核心贡献

核心贡献

  • 提出 写带宽前沿:在匹配任务成功率的前提下,将内存写入次数降低 4.98–9.19 倍,简单随机或周期性写策略无法恢复这一增益
  • 实现 O(1) 推理状态 VRAM:记忆状态固定为 4,224 字节(与步数无关),在 100k 步全量推理中保持恒定,对比 KV 缓存减少 6,061 倍
  • 实例化并测量了动作充分性价值损失界:基于 Subramanian 等人的理论,实证测量了 \( \varepsilon \) 和 \( \delta \) 指标,作为方法学演示
  • 提供训练 KV 缓存头对头对比真实 VLA 面板:在稀疏回忆任务上与训练好的 KV 缓存 Transformer 达到准确率持平,并在 OpenVLA-OFT 7B 真实机器人策略上验证了门控机制不损害成功率
Card 04 方法描述

方法描述

  • 将 VLA 策略建模为 POMDP,用单个固定大小的快速权重矩阵 \( W \) 替代 KV 缓存,矩阵形状与步数无关
  • 通过测试时训练更新 \( W \):使用闭式梯度下降步骤,将当前帧的键值对融入记忆,并引入可学习的遗忘因子和学习率
  • 设计动作错误驱动的二值写入门:基于当前帧的预测误差(惊异信号)和前一步记忆读出,通过门控 MLP 输出写概率,采用直通估计器保持可微分
  • 训练目标为闭环动作交叉熵损失 + 信息瓶颈正则项 + 写率惩罚,直接从动作效用角度优化记忆写入的选择性,而非依赖重建损失
Card 05 数据集与资源

数据集与资源

  • 主要使用合成基准测试:noisy_long_recall(带噪声的长程回忆)和 sparse_recall(稀疏回忆)
  • 也使用 LIBERO-Long 任务进行真实机器人策略验证
  • 模型规模:记忆模块参数总计约 30,279(N=32 时),梯度活跃参数 21,447,冻结的 VLA 骨干网络为 OpenVLA-OFT 7B
  • 训练资源:L40S GPU,进行 100k 步的无限长推理状态压力测试
Card 06 评估与结果

评估与结果

  • noisy_long_recall 任务上,AURA-Mem 在 N=64 时达到 1.000 成功率,与最佳 O(1) 基线持平,但写入次数减少 5.19–6.13 倍(N=16/32/64)
  • sparse_recall 任务上,AURA-Mem 与训练好的 KV 缓存 Transformer 在水平 T=128–1024 时准确率持平(均 ≈1.000),但记忆占用恒定(在 T=1024 时 KV 基线占用 62.1 倍字节)
  • 在真实机器人面板(LIBERO-Long,n=60 回合/臂)上,AURA-Mem 成功率 0.233,与无门控基线和 KV 基线持平,写入次数减少 7.0 倍
  • 动作充分性证书测量:\( \varepsilon_{\text{mean}} = 0.0021 \),\( \varepsilon_{q95} = 0.0076 \),但 \( L_V \) 加载的界在当前规模下无效,不作为正式保障