一眼看懂
封面预览
针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法
- 针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法
- 设计了一个固定大小的记忆模块,通过动作驱动的门控机制决定何时写入记忆,在保持任务性能的同时大幅减少内存写入次数
- 在合成基准测试上,实现了与最优 O(1) 基线相当的任务成功率,但写入次数减少 4.98–9.19 倍
Card 01
研究单位
研究单位
- KAIKAKU(作者 Josef Chen 所属机构)
Card 02
论文概述
论文概述
- 针对机器人策略在边缘硬件上运行时,KV 缓存随步数线性增长导致 VRAM 和内存带宽成为瓶颈的问题,提出 AURA-Mem 方法
- 设计了一个固定大小的记忆模块,通过动作驱动的门控机制决定何时写入记忆,在保持任务性能的同时大幅减少内存写入次数
- 在合成基准测试上,实现了与最优 O(1) 基线相当的任务成功率,但写入次数减少 4.98–9.19 倍
Card 03
核心贡献
核心贡献
- 提出 写带宽前沿:在匹配任务成功率的前提下,将内存写入次数降低 4.98–9.19 倍,简单随机或周期性写策略无法恢复这一增益
- 实现 O(1) 推理状态 VRAM:记忆状态固定为 4,224 字节(与步数无关),在 100k 步全量推理中保持恒定,对比 KV 缓存减少 6,061 倍
- 实例化并测量了动作充分性价值损失界:基于 Subramanian 等人的理论,实证测量了 \( \varepsilon \) 和 \( \delta \) 指标,作为方法学演示
- 提供训练 KV 缓存头对头对比和真实 VLA 面板:在稀疏回忆任务上与训练好的 KV 缓存 Transformer 达到准确率持平,并在 OpenVLA-OFT 7B 真实机器人策略上验证了门控机制不损害成功率
Card 04
方法描述
方法描述
- 将 VLA 策略建模为 POMDP,用单个固定大小的快速权重矩阵 \( W \) 替代 KV 缓存,矩阵形状与步数无关
- 通过测试时训练更新 \( W \):使用闭式梯度下降步骤,将当前帧的键值对融入记忆,并引入可学习的遗忘因子和学习率
- 设计动作错误驱动的二值写入门:基于当前帧的预测误差(惊异信号)和前一步记忆读出,通过门控 MLP 输出写概率,采用直通估计器保持可微分
- 训练目标为闭环动作交叉熵损失 + 信息瓶颈正则项 + 写率惩罚,直接从动作效用角度优化记忆写入的选择性,而非依赖重建损失
Card 05
数据集与资源
数据集与资源
- 主要使用合成基准测试:noisy_long_recall(带噪声的长程回忆)和 sparse_recall(稀疏回忆)
- 也使用 LIBERO-Long 任务进行真实机器人策略验证
- 模型规模:记忆模块参数总计约 30,279(N=32 时),梯度活跃参数 21,447,冻结的 VLA 骨干网络为 OpenVLA-OFT 7B
- 训练资源:L40S GPU,进行 100k 步的无限长推理状态压力测试
Card 06
评估与结果
评估与结果
- 在 noisy_long_recall 任务上,AURA-Mem 在 N=64 时达到 1.000 成功率,与最佳 O(1) 基线持平,但写入次数减少 5.19–6.13 倍(N=16/32/64)
- 在 sparse_recall 任务上,AURA-Mem 与训练好的 KV 缓存 Transformer 在水平 T=128–1024 时准确率持平(均 ≈1.000),但记忆占用恒定(在 T=1024 时 KV 基线占用 62.1 倍字节)
- 在真实机器人面板(LIBERO-Long,n=60 回合/臂)上,AURA-Mem 成功率 0.233,与无门控基线和 KV 基线持平,写入次数减少 7.0 倍
- 动作充分性证书测量:\( \varepsilon_{\text{mean}} = 0.0021 \),\( \varepsilon_{q95} = 0.0076 \),但 \( L_V \) 加载的界在当前规模下无效,不作为正式保障