一眼看懂
封面预览
论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。
- 论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。
- 核心问题是评估 WAMs 是否仅增加了未来预测模块,还是真正改变了机器人行为并产生了可用于控制的内部表征。
- 提出了一个模型无关的诊断框架,通过行为 rollout 分析和基于 Sparse Autoencoders (SAE) 的特征空间分析来对比两类模型。
Card 01
研究单位
研究单位
- National Economics University, Vietnam
- N2TP Technology
- Singapore Management University
- Phenikaa University, Vietnam
Card 02
论文概述
论文概述
- 论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。
- 核心问题是评估 WAMs 是否仅增加了未来预测模块,还是真正改变了机器人行为并产生了可用于控制的内部表征。
- 提出了一个模型无关的诊断框架,通过行为 rollout 分析和基于 Sparse Autoencoders (SAE) 的特征空间分析来对比两类模型。
Card 03
核心贡献
核心贡献
- 提出了一个综合诊断框架,包含行为层面的 rollout 诊断(动作平滑性、目标进度、干扰物稳定性)和表征层面的特征分析。
- 定义了精细的行为指标,如动作动态一致性、Chunk 边界不连续性、低运动失败率以及错误物体干扰度量。
- 引入了基于 TopK SAE 的特征空间诊断方法,提出 Future Consistency Score (FCS) 和 Action Predictiveness (AP) 等指标,将内部特征分类为记忆型、反应型或预测型。
- 在 LIBERO 和 RoboTwin2.0 上对 7 种策略进行了系统评估,揭示了不同架构 WAMs(联合、序列、辅助)在行为和表征上的优劣与权衡。
Card 04
方法描述
方法描述
- 行为 Rollout 分析:测量执行动作序列的一阶、二阶、三阶差分(Delta, Accel, Jerk)以评估平滑性;计算目标物体进度曲线和干扰物运动路径以评估选择性和稳定性。
- 特征空间分析:利用 Sparse Autoencoders (SAE) 对模型的视觉、未来想象和动作潜变量进行解码,提取稀疏特征基。
- 通过计算特征的覆盖度、运行长度及面向未来的指标(FCS, HS, AP),训练分类器将特征标记为 Predictive-general、Reactive-general 或 Memorized,从而量化模型的预测能力。
Card 05
数据集与资源
数据集与资源
- LIBERO 基准:包含 Spatial, Object, Goal, Long 四个子任务集,每个任务 50 次试验。
- RoboTwin2.0 基准:包含 50 个任务,评估了公开可用的检查点子集。
- 模型:评估了 π₀, π₀.₅, X-VLA(VLA 类);Cosmos Policy(联合 WAM)、LingBot-VA(序列 WAM)、FastWAM, VLA-JEPA(辅助 WAM)。
- 硬件资源:使用单个 RTX 6000 Ada GPU 进行评估。
Card 06
评估与结果
评估与结果
- 行为结果显示,WAMs(如 LingBot-VA 和 Cosmos)通常产生更平滑的控制和更强的目标物体进度,错误物体干扰显著低于 VLA 策略。
- 推理成本分析表明,序列 WAMs(如 LingBot-VA)推理延迟极高(p50 延迟达 4701ms),而辅助 WAMs 虽然速度快但牺牲了推理时“想象”带来的空间感知优势。
- 特征空间分析证实,序列 WAMs 展示了最清晰的预测结构特征,而辅助 WAMs 倾向于压缩未来信息,联合 WAMs 则编码了更复杂但纠缠的轨迹信息。
- 结论指出,单纯的成功率掩盖了 WAMs 在物体选择性和干扰鲁棒性上的优势,未来设计需在保留可操作的未来表征与降低推理成本之间寻找平衡。