一眼看懂
封面预览
提出 AffordanceVLA,一种引入结构化可供性预测作为中间表示的视觉-语言-动作模型,旨在建立更精确的感知-动作映射
- 提出 AffordanceVLA,一种引入结构化可供性预测作为中间表示的视觉-语言-动作模型,旨在建立更精确的感知-动作映射
- 解决因视觉语言模型语义空间与具身控制策略之间结构不匹配导致的感知-动作映射学习困难问题
- 通过建模“操作什么、在何处操作、如何操作”的可供性先验,自然连接视觉、语言与动作
Card 01
研究单位
研究单位
- 北京大学
- 香港科技大学(广州)
- 香港中文大学
- Knowin AI
Card 02
论文概述
论文概述
- 提出 AffordanceVLA,一种引入结构化可供性预测作为中间表示的视觉-语言-动作模型,旨在建立更精确的感知-动作映射
- 解决因视觉语言模型语义空间与具身控制策略之间结构不匹配导致的感知-动作映射学习困难问题
- 通过建模“操作什么、在何处操作、如何操作”的可供性先验,自然连接视觉、语言与动作
Card 03
核心贡献
核心贡献
- 提出 AffordanceVLA 框架,通过 Which2Act(物体中心视觉预测)、Where2Act(2D 交互定位)和 How2Act(3D 几何推理)实现结构化可供性预测作为中间监督
- 设计 Mixture-of-Transformer (MoT) 架构,包含理解专家、可供性生成专家和动作专家,并采用 UAA 渐进注意力机制,配合三阶段渐进式训练策略
- 开发一套自动化数据增强管道,为大规模机器人数据合成密集的可供性标注,克服数据稀缺问题
- 在仿真和真实世界实验中取得与强基线竞争的成功率,展现出优异的泛化性、鲁棒性和指令敏感性
Card 04
方法描述
方法描述
- 采用 MoT 架构 将视觉-语言对齐、可供性预测和动作执行解耦至三个专门专家,通过单向注意力流防止信息泄露
- 可供性生成专家并行预测三种互补线索:Which2Act 通过重构目标视觉潜变量实现物体定位;Where2Act 预测 2D 可供性热力图;How2Act 通过扩散过程生成 3D 形状并回归空间布局
- 三阶段训练策略:Stage I 在通用 VQA 和交互场景数据上预训练可供性生成专家;Stage II 在大规模合成机器人数据上联合训练整个模型;Stage III 在目标环境上微调
- 设计自动化数据标注流程,利用大语言模型和视觉基础模型为机器人数据生成关键帧级别的可供性标注
Card 05
数据集与资源
数据集与资源
- 预训练数据:AGD20K、RefSpatial(指称定位),PRISM(交互场景)
- 机器人数据:InternData-A1(大规模合成数据),LIBERO、CALVIN(仿真基准),DROID(真实机器人数据)
- 模型规模:基于 Pi0 架构,具体参数量未在论文中明确说明
- 训练资源:论文未明确说明,推测使用多 GPU 训练
Card 06
评估与结果
评估与结果
- 评估基准:LIBERO(Spatial、Object、Goal、Long 四个任务套件)和 CALVIN ABC→D(零样本 OOD 长序列任务)
- 主要指标:任务成功率(%),平均完成链长度(Avg. Len)
- AffordanceVLA (full) 在 LIBERO 上平均成功率达 95.8%,在 CALVIN 上平均完成长度 4.33,5 任务全部完成率 75.9%
- 消融实验证实:解耦的 MoT 架构、联合优化的可供性预测以及三阶段训练策略对性能提升至关重要,单独增加数据量或冻结可供性表示均会导致性能大幅下降