一眼看懂
封面预览
论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。
- 论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。
- 指出在具有不同特性关节组(机械臂、夹爪、头部、移动底座)的机器人上,容易预测的关节组会掩盖难预测关节组的误差,导致最低总 MSE 的检查点在实际部署中表现并非最佳。
- 提出使用 Per-Group Error(分组误差) 替代总 MSE 作为选择检查点的更可靠信号。
Card 01
研究单位
研究单位
- 论文作者:Pau Montagut Bofi, Mario García Blasco, Tessa Pulli, Markus Vincze
- 作者所属机构在提供的 HTML 文本中未明确列出,但作者 Markus Vincze 通常与维也纳工业大学相关联。
Card 02
论文概述
论文概述
- 论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。
- 指出在具有不同特性关节组(机械臂、夹爪、头部、移动底座)的机器人上,容易预测的关节组会掩盖难预测关节组的误差,导致最低总 MSE 的检查点在实际部署中表现并非最佳。
- 提出使用 Per-Group Error(分组误差) 替代总 MSE 作为选择检查点的更可靠信号。
Card 03
核心贡献
核心贡献
- 揭示了微调 VLA 模型时的反直觉现象:总 MSE 最低的检查点在真实机器人上的表现可能不如总 MSE 较高的基线模型。
- 提出了一种按关节组(机械臂、夹爪、头部、底座)分解误差的分析方法,揭示了不同模型和训练机制下的收敛瓶颈差异。
- 发现 SmolVLA 的训练瓶颈在于移动底座收敛最慢,而 π₀.₅ 专家微调的部署瓶颈在于机械臂精度退化。
- 在 Toyota HSR 机器人上进行了 60 次真实世界试验验证,证明了分组误差与实际表现的一致性。
Card 04
方法描述
方法描述
- 使用 SmolVLA (450M 参数) 和 π₀.₅ (3.3B 参数) 两种 VLA 模型,针对 Toyota HSR 的 11 自由度动作空间进行微调。
- SmolVLA 采用两阶段训练:阶段一在 HSR 数据集预训练,阶段二在特定任务上微调;使用 Flow Matching 生成动作。
- π₀.₅ 进行了专家微调,冻结视觉语言主干网络,仅训练动作头。
- 将 11 维动作向量分解为四个功能组,分别计算 MSE,以分析各部分的训练动态。
Card 05
数据集与资源
数据集与资源
- 机器人平台:Toyota HSR (Human Support Robot),11 自由度(机械臂、夹爪、头部、移动底座)。
- 训练数据:ICRA 2026 workshop dataset,包含 109,269 个片段用于预训练,3,971 个片段用于特定任务微调。
- 计算资源:使用单张 RTX 3090 (24GB) 进行训练。
- 模型规模:SmolVLA 450M 参数,π₀.₅ 3.3B 参数。
Card 06
评估与结果
评估与结果
- 离线评估:在 10 个保留片段(200 帧)上评估,发现 SmolVLA 的底座误差收敛最慢,π₀.₅ 专家微调虽然降低了总 MSE 但增加了机械臂误差。
- 真实机器人评估:进行了 60 次抓取试验,π₀.₅ 基线模型得分 4.0/4,优于总 MSE 更低的微调模型(3.75/4)和 HSR-SmolVLA(3.5/4)。
- 关键发现:实际机器人表现的排序与离线的机械臂分组误差一致,而非总 MSE 或底座误差。
- 结论:对于异构动作空间,分组误差比总 MSE 更能可靠地预测模型在真实机器人上的表现。