返回列表
VLA / Vision-Language-Action 每日论文卡
Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA
论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。

论文详情

Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA

2026-05-31 · 原文 · 翻译 · 2606.01095

论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。 核心问题是评估 WAMs 是否仅增加了未来预测模块,还是真正改变了机器人行为并产生了可用于控制的内部表征。 提出了一个模型无关的诊断框架,通过行为 rollout 分析和基于 Sparse Autoencoders (SAE) 的特征空间分析来对比两类模型。

6 分钟读完 6 张阅读卡 National Economics University, Vietnam
一眼看懂 封面预览

论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。

  • 论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM) 与 Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。
  • 核心问题是评估 WAMs 是否仅增加了未来预测模块,还是真正改变了机器人行为并产生了可用于控制的内部表征。
  • 提出了一个模型无关的诊断框架,通过行为 rollout 分析和基于 Sparse Autoencoders (SAE) 的特征空间分析来对比两类模型。
Card 01 研究单位

研究单位

  • National Economics University, Vietnam
  • N2TP Technology
  • Singapore Management University
  • Phenikaa University, Vietnam
Card 02 论文概述

论文概述

  • 论文旨在超越单纯的任务成功率,深入探究 World-Action Models (WAM)Vision-Language-Action (VLA) 策略在机器人操作中的行为与表征差异。
  • 核心问题是评估 WAMs 是否仅增加了未来预测模块,还是真正改变了机器人行为并产生了可用于控制的内部表征。
  • 提出了一个模型无关的诊断框架,通过行为 rollout 分析和基于 Sparse Autoencoders (SAE) 的特征空间分析来对比两类模型。
Card 03 核心贡献

核心贡献

  • 提出了一个综合诊断框架,包含行为层面的 rollout 诊断(动作平滑性、目标进度、干扰物稳定性)和表征层面的特征分析。
  • 定义了精细的行为指标,如动作动态一致性、Chunk 边界不连续性、低运动失败率以及错误物体干扰度量。
  • 引入了基于 TopK SAE 的特征空间诊断方法,提出 Future Consistency Score (FCS)Action Predictiveness (AP) 等指标,将内部特征分类为记忆型、反应型或预测型。
  • LIBERORoboTwin2.0 上对 7 种策略进行了系统评估,揭示了不同架构 WAMs(联合、序列、辅助)在行为和表征上的优劣与权衡。
Card 04 方法描述

方法描述

  • 行为 Rollout 分析:测量执行动作序列的一阶、二阶、三阶差分(Delta, Accel, Jerk)以评估平滑性;计算目标物体进度曲线和干扰物运动路径以评估选择性和稳定性。
  • 特征空间分析:利用 Sparse Autoencoders (SAE) 对模型的视觉、未来想象和动作潜变量进行解码,提取稀疏特征基。
  • 通过计算特征的覆盖度、运行长度及面向未来的指标(FCS, HS, AP),训练分类器将特征标记为 Predictive-generalReactive-generalMemorized,从而量化模型的预测能力。
Card 05 数据集与资源

数据集与资源

  • LIBERO 基准:包含 Spatial, Object, Goal, Long 四个子任务集,每个任务 50 次试验。
  • RoboTwin2.0 基准:包含 50 个任务,评估了公开可用的检查点子集。
  • 模型:评估了 π₀, π₀.₅, X-VLA(VLA 类);Cosmos Policy(联合 WAM)、LingBot-VA(序列 WAM)、FastWAM, VLA-JEPA(辅助 WAM)。
  • 硬件资源:使用单个 RTX 6000 Ada GPU 进行评估。
Card 06 评估与结果

评估与结果

  • 行为结果显示,WAMs(如 LingBot-VACosmos)通常产生更平滑的控制和更强的目标物体进度,错误物体干扰显著低于 VLA 策略。
  • 推理成本分析表明,序列 WAMs(如 LingBot-VA)推理延迟极高(p50 延迟达 4701ms),而辅助 WAMs 虽然速度快但牺牲了推理时“想象”带来的空间感知优势。
  • 特征空间分析证实,序列 WAMs 展示了最清晰的预测结构特征,而辅助 WAMs 倾向于压缩未来信息,联合 WAMs 则编码了更复杂但纠缠的轨迹信息。
  • 结论指出,单纯的成功率掩盖了 WAMs 在物体选择性和干扰鲁棒性上的优势,未来设计需在保留可操作的未来表征与降低推理成本之间寻找平衡。