返回列表
VLA / Vision-Language-Action 每日论文卡
FATE-VLA:Failue-aware test generation for vision-language-action models
论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。

论文详情

FATE-VLA:Failue-aware test generation for vision-language-action models

2026-06-01 · 原文 · 翻译 · 2606.02307

论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。 提出将 VLA 评估重新定义为 主动失败发现 问题,旨在通过自适应测试生成揭示模型弱点。 提出了 FATE-VLA 方法,结合多样性驱动探索与代理模型,能够发现更多且更多样化的失败案例。

5 分钟读完 6 张阅读卡 Mondragon University (Mondragon, Spain)
一眼看懂 封面预览

论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。

  • 论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。
  • 提出将 VLA 评估重新定义为 主动失败发现 问题,旨在通过自适应测试生成揭示模型弱点。
  • 提出了 FATE-VLA 方法,结合多样性驱动探索与代理模型,能够发现更多且更多样化的失败案例。
Card 01 研究单位

研究单位

  • Mondragon University (Mondragon, Spain)
  • Simula Research Laboratory (Oslo, Norway)
Card 02 论文概述

论文概述

  • 论文指出当前 Vision-Language-Action (VLA) 模型的评估主要依赖静态基准随机采样,容易低估在高维具身空间中的鲁棒性风险。
  • 提出将 VLA 评估重新定义为 主动失败发现 问题,旨在通过自适应测试生成揭示模型弱点。
  • 提出了 FATE-VLA 方法,结合多样性驱动探索与代理模型,能够发现更多且更多样化的失败案例。
Card 03 核心贡献

核心贡献

  • 将 VLA 测试定义为 主动失败发现问题,强调失败检测与失败多样性的双重重要性。
  • 提出了 FATE-VLA,一种结合多样性驱动探索(FSCS-ART)与代理辅助失败预测的测试生成方法。
  • 引入了轨迹级和对象级的失败多样性指标(TCF 和 FOC),超越了传统的成功率评估。
  • 在四个最先进的 VLA 模型上进行了实证评估,提供了完整的复现包。
Card 04 方法描述

方法描述

  • 提出两种混合算法:Algorithm 1 (Hybrid Sorted Surrogate Assisted FSCS-ART)Algorithm 2 (Hybrid Adaptive RF-Guided FSCS-ART)
  • 初始阶段利用 FSCS-ART 算法通过最大化最小距离进行多样性采样,以探索输入空间。
  • 当积累足够的成功/失败数据后,训练 Decision Tree (DT)Random Forest (RF) 作为代理模型预测失败概率。
  • 后续生成阶段结合代理模型的失败预测与多样性距离,通过排序或加权评分机制优先选择高风险且多样的测试场景。
Card 05 数据集与资源

数据集与资源

  • 评估对象为四种 VLA 模型:OpenVLA$\pi_0$GR00T-N1.6EO-1
  • 使用 SimplerEnv 模拟环境,选取“拿起”任务,包含 7 种不同的操作对象(如红牛罐、苹果等)。
  • 采用轻量级机器学习模型作为代理:Decision Tree (最大深度 8) 和 Random Forest (150棵树,最大深度 12)。
Card 06 评估与结果

评估与结果

  • 对比基线为随机算法和纯 FSCS-ART 算法。
  • 主要评估指标包括:Failure Rate (FR)Trajectory Coverage (TC)Trajectory Coverage under Failure (TCF)Failed Object Coverage (FOC)
  • 实验结果显示,在 GR00T-N1.6 模型上,提出方法的失败率比基线提高了 +29.7%(成功率从 64.4% 降至 34.7%)。
  • 结果表明机器学习模型(DT/RF)是提升失败发现效果的关键驱动力,单纯的多样性探索对失败检测贡献有限。