返回列表
VLA / Vision-Language-Action 每日论文卡
RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models
提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。

论文详情

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models

2026-06-01 · 原文 · 翻译 · 2606.02277

提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。 论文旨在揭示当前VLA模型可能通过视觉或指令-动作捷径完成任务,而非真正利用预训练语言模型的语义理解能力来指导动作生成。 主要问题是,在机器人微调过程中,语义专家的能力可能被削弱或与动作专家解耦,导致模型无法根据复杂指令语义选择正确的物理目标。

5 分钟读完 6 张阅读卡 HIT(哈尔滨工业大学)
一眼看懂 封面预览

提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。

  • 提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。
  • 论文旨在揭示当前VLA模型可能通过视觉或指令-动作捷径完成任务,而非真正利用预训练语言模型的语义理解能力来指导动作生成。
  • 主要问题是,在机器人微调过程中,语义专家的能力可能被削弱或与动作专家解耦,导致模型无法根据复杂指令语义选择正确的物理目标。
Card 01 研究单位

研究单位

  • HIT(哈尔滨工业大学)
  • ZGCA(中关村学院)
  • ZGCI(中关村人工智能研究院)
  • WHU(武汉大学)
  • HUST(华中科技大学)
  • HKUST(GZ)(香港科技大学广州)
  • BUAA(北京航空航天大学)
  • ECNU(华东师范大学)
  • DeepCybo
Card 02 论文概述

论文概述

  • 提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。
  • 论文旨在揭示当前VLA模型可能通过视觉或指令-动作捷径完成任务,而非真正利用预训练语言模型的语义理解能力来指导动作生成。
  • 主要问题是,在机器人微调过程中,语义专家的能力可能被削弱或与动作专家解耦,导致模型无法根据复杂指令语义选择正确的物理目标。
Card 03 核心贡献

核心贡献

  • 引入 RoboSemanticBench,将数学、难题数学和常识理解转化为具身答案选择任务,包含六个评估套件(RSB-Math, RSB-HardMath, RSB-General 的4选项和10选项版本)。
  • 定义 GSR(抓取成功率)TSR(任务成功率)nSG(归一化语义接地分数) 三个指标,以分离低级抓取能力与语义目标选择。
  • 对代表性VLA模型(如OpenVLA、π₀、π₀.₅等)进行评估,揭示许多模型在语义目标选择上表现接近或低于随机水平。
  • 报告并分析了失败的干预尝试(ReasoningVLAVLA共训练),表明现有方法无法可靠弥合语义接地差距。
Card 04 方法描述

方法描述

  • 将语义理解作为选择正确物理动作的必要条件:机器人接收多选数学或常识问题,观察候选答案块,并抓取对应正确答案的块。
  • 固定操作基元(抓取-放置),变化指令的语义内容和选项映射,以测试指令语义是否真正参与目标选择。
  • 通过 GSR-TSR分解nSG指标 排除抓取能力的影响,精准诊断语义决策是否被传递到动作生成路径。
  • 设计控制泄露的指令模板,确保模型必须理解问题并绑定答案到可见目标,而非依赖标签泄露。
Card 05 数据集与资源

数据集与资源

  • RSB-Math: 500个程序生成的算术问题(两位数加减乘)。
  • RSB-HardMath: 来自 GSM8K 的7,473个小学应用题。
  • RSB-General: 10,000个 MMLU-style 常识与事实问答问题。
  • 每个子集均包含4选项和10选项的评估套件,以测试不同语义动作空间。
  • 训练数据通过脚本化专家在模拟器中生成,使用 Aloha-AgileX 双臂机器人和多视角RGB相机。
Card 06 评估与结果

评估与结果

  • 评估环境为物理仿真桌面环境,使用脚本化专家生成训练轨迹。
  • 主要指标为 TSR(任务成功率)GSR(抓取成功率)nSG(归一化语义接地分数)
  • 关键结果:多数VLA模型在排除抓取成功后,语义目标选择表现接近或低于随机(4选项套件约25%,10选项套件约10%)。
  • π₀.₅ 表现相对最佳(平均TSR 21.8%,平均nSG 5.2%),但语义接地能力仍不理想。
  • ReasoningVLAVLA共训练 的干预尝试未能显著改善语义接地问题,甚至共训练导致性能下降。
  • 错误分析显示,失败主要源于选择了错误的语义目标,而非抓取或放置失败。