一眼看懂
封面预览
论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。
- 论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。
- 提出将 VLA 评估重新定义为 主动失败发现 问题,旨在通过自适应测试生成揭示模型弱点。
- 提出了 FATE-VLA 方法,结合多样性驱动探索与代理模型,能够发现更多且更多样化的失败案例。
Card 01
研究单位
研究单位
- Mondragon University (Mondragon, Spain)
- Simula Research Laboratory (Oslo, Norway)
Card 02
论文概述
论文概述
- 论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。
- 提出将 VLA 评估重新定义为 主动失败发现 问题,旨在通过自适应测试生成揭示模型弱点。
- 提出了 FATE-VLA 方法,结合多样性驱动探索与代理模型,能够发现更多且更多样化的失败案例。
Card 03
核心贡献
核心贡献
- 将 VLA 测试定义为 主动失败发现问题,强调失败检测与失败多样性的双重重要性。
- 提出了 FATE-VLA,一种结合多样性驱动探索(FSCS-ART)与代理辅助失败预测的测试生成方法。
- 引入了轨迹级和对象级的失败多样性指标(TCF 和 FOC),超越了传统的成功率评估。
- 在四个最先进的 VLA 模型上进行了实证评估,提供了完整的复现包。
Card 04
方法描述
方法描述
- 提出两种混合算法:Algorithm 1 (Hybrid Sorted Surrogate Assisted FSCS-ART) 和 Algorithm 2 (Hybrid Adaptive RF-Guided FSCS-ART)。
- 初始阶段利用 FSCS-ART 算法通过最大化最小距离进行多样性采样,以探索输入空间。
- 当积累足够的成功/失败数据后,训练 Decision Tree (DT) 或 Random Forest (RF) 作为代理模型预测失败概率。
- 后续生成阶段结合代理模型的失败预测与多样性距离,通过排序或加权评分机制优先选择高风险且多样的测试场景。
Card 05
数据集与资源
数据集与资源
- 评估对象为四种 VLA 模型:OpenVLA、$\pi_0$、GR00T-N1.6 和 EO-1。
- 使用 SimplerEnv 模拟环境,选取“拿起”任务,包含 7 种不同的操作对象(如红牛罐、苹果等)。
- 采用轻量级机器学习模型作为代理:Decision Tree (最大深度 8) 和 Random Forest (150棵树,最大深度 12)。
Card 06
评估与结果
评估与结果
- 对比基线为随机算法和纯 FSCS-ART 算法。
- 主要评估指标包括:Failure Rate (FR)、Trajectory Coverage (TC)、Trajectory Coverage under Failure (TCF) 和 Failed Object Coverage (FOC)。
- 实验结果显示,在 GR00T-N1.6 模型上,提出方法的失败率比基线提高了 +29.7%(成功率从 64.4% 降至 34.7%)。
- 结果表明机器学习模型(DT/RF)是提升失败发现效果的关键驱动力,单纯的多样性探索对失败检测贡献有限。