一眼看懂
封面预览
提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。
- 提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。
- 论文旨在揭示当前VLA模型可能通过视觉或指令-动作捷径完成任务,而非真正利用预训练语言模型的语义理解能力来指导动作生成。
- 主要问题是,在机器人微调过程中,语义专家的能力可能被削弱或与动作专家解耦,导致模型无法根据复杂指令语义选择正确的物理目标。
Card 01
研究单位
研究单位
- HIT(哈尔滨工业大学)
- ZGCA(中关村学院)
- ZGCI(中关村人工智能研究院)
- WHU(武汉大学)
- HUST(华中科技大学)
- HKUST(GZ)(香港科技大学广州)
- BUAA(北京航空航天大学)
- ECNU(华东师范大学)
- DeepCybo
Card 02
论文概述
论文概述
- 提出名为 RoboSemanticBench (RSB) 的具身基准,用于诊断 VLA(视觉-语言-动作)模型 在动作预测中的 语义接地 能力。
- 论文旨在揭示当前VLA模型可能通过视觉或指令-动作捷径完成任务,而非真正利用预训练语言模型的语义理解能力来指导动作生成。
- 主要问题是,在机器人微调过程中,语义专家的能力可能被削弱或与动作专家解耦,导致模型无法根据复杂指令语义选择正确的物理目标。
Card 03
核心贡献
核心贡献
- 引入 RoboSemanticBench,将数学、难题数学和常识理解转化为具身答案选择任务,包含六个评估套件(RSB-Math, RSB-HardMath, RSB-General 的4选项和10选项版本)。
- 定义 GSR(抓取成功率)、TSR(任务成功率) 和 nSG(归一化语义接地分数) 三个指标,以分离低级抓取能力与语义目标选择。
- 对代表性VLA模型(如OpenVLA、π₀、π₀.₅等)进行评估,揭示许多模型在语义目标选择上表现接近或低于随机水平。
- 报告并分析了失败的干预尝试(ReasoningVLA 和 VLA共训练),表明现有方法无法可靠弥合语义接地差距。
Card 04
方法描述
方法描述
- 将语义理解作为选择正确物理动作的必要条件:机器人接收多选数学或常识问题,观察候选答案块,并抓取对应正确答案的块。
- 固定操作基元(抓取-放置),变化指令的语义内容和选项映射,以测试指令语义是否真正参与目标选择。
- 通过 GSR-TSR分解 和 nSG指标 排除抓取能力的影响,精准诊断语义决策是否被传递到动作生成路径。
- 设计控制泄露的指令模板,确保模型必须理解问题并绑定答案到可见目标,而非依赖标签泄露。
Card 05
数据集与资源
数据集与资源
- RSB-Math: 500个程序生成的算术问题(两位数加减乘)。
- RSB-HardMath: 来自 GSM8K 的7,473个小学应用题。
- RSB-General: 10,000个 MMLU-style 常识与事实问答问题。
- 每个子集均包含4选项和10选项的评估套件,以测试不同语义动作空间。
- 训练数据通过脚本化专家在模拟器中生成,使用 Aloha-AgileX 双臂机器人和多视角RGB相机。
Card 06
评估与结果
评估与结果
- 评估环境为物理仿真桌面环境,使用脚本化专家生成训练轨迹。
- 主要指标为 TSR(任务成功率)、GSR(抓取成功率) 和 nSG(归一化语义接地分数)。
- 关键结果:多数VLA模型在排除抓取成功后,语义目标选择表现接近或低于随机(4选项套件约25%,10选项套件约10%)。
- π₀.₅ 表现相对最佳(平均TSR 21.8%,平均nSG 5.2%),但语义接地能力仍不理想。
- ReasoningVLA 和 VLA共训练 的干预尝试未能显著改善语义接地问题,甚至共训练导致性能下降。
- 错误分析显示,失败主要源于选择了错误的语义目标,而非抓取或放置失败。