返回列表
VLA / Vision-Language-Action 每日论文卡
Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation
论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。

论文详情

Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation

2026-05-29 · 原文 · 翻译 · 2606.00253

论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。 指出在具有不同特性关节组(机械臂、夹爪、头部、移动底座)的机器人上,容易预测的关节组会掩盖难预测关节组的误差,导致最低总 MSE 的检查点在实际部署中表现并非最佳。 提出使用 Per-Group Error(分组误差) 替代总 MSE 作为选择检查点的更可靠信号。

5 分钟读完 6 张阅读卡 论文作者:Pau Montagut Bofi, Mario García Blasco, Tessa…
一眼看懂 封面预览

论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。

  • 论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。
  • 指出在具有不同特性关节组(机械臂、夹爪、头部、移动底座)的机器人上,容易预测的关节组会掩盖难预测关节组的误差,导致最低总 MSE 的检查点在实际部署中表现并非最佳。
  • 提出使用 Per-Group Error(分组误差) 替代总 MSE 作为选择检查点的更可靠信号。
Card 01 研究单位

研究单位

  • 论文作者:Pau Montagut Bofi, Mario García Blasco, Tessa Pulli, Markus Vincze
  • 作者所属机构在提供的 HTML 文本中未明确列出,但作者 Markus Vincze 通常与维也纳工业大学相关联。
Card 02 论文概述

论文概述

  • 论文研究了在异构关节空间的移动操作机器人上微调 Vision-Language-Action (VLA) 模型时,总 MSE(均方误差)作为评价指标的局限性。
  • 指出在具有不同特性关节组(机械臂、夹爪、头部、移动底座)的机器人上,容易预测的关节组会掩盖难预测关节组的误差,导致最低总 MSE 的检查点在实际部署中表现并非最佳。
  • 提出使用 Per-Group Error(分组误差) 替代总 MSE 作为选择检查点的更可靠信号。
Card 03 核心贡献

核心贡献

  • 揭示了微调 VLA 模型时的反直觉现象:总 MSE 最低的检查点在真实机器人上的表现可能不如总 MSE 较高的基线模型。
  • 提出了一种按关节组(机械臂、夹爪、头部、底座)分解误差的分析方法,揭示了不同模型和训练机制下的收敛瓶颈差异。
  • 发现 SmolVLA 的训练瓶颈在于移动底座收敛最慢,而 π₀.₅ 专家微调的部署瓶颈在于机械臂精度退化。
  • Toyota HSR 机器人上进行了 60 次真实世界试验验证,证明了分组误差与实际表现的一致性。
Card 04 方法描述

方法描述

  • 使用 SmolVLA (450M 参数) 和 π₀.₅ (3.3B 参数) 两种 VLA 模型,针对 Toyota HSR 的 11 自由度动作空间进行微调。
  • SmolVLA 采用两阶段训练:阶段一在 HSR 数据集预训练,阶段二在特定任务上微调;使用 Flow Matching 生成动作。
  • π₀.₅ 进行了专家微调,冻结视觉语言主干网络,仅训练动作头。
  • 将 11 维动作向量分解为四个功能组,分别计算 MSE,以分析各部分的训练动态。
Card 05 数据集与资源

数据集与资源

  • 机器人平台:Toyota HSR (Human Support Robot),11 自由度(机械臂、夹爪、头部、移动底座)。
  • 训练数据:ICRA 2026 workshop dataset,包含 109,269 个片段用于预训练,3,971 个片段用于特定任务微调。
  • 计算资源:使用单张 RTX 3090 (24GB) 进行训练。
  • 模型规模:SmolVLA 450M 参数,π₀.₅ 3.3B 参数。
Card 06 评估与结果

评估与结果

  • 离线评估:在 10 个保留片段(200 帧)上评估,发现 SmolVLA 的底座误差收敛最慢,π₀.₅ 专家微调虽然降低了总 MSE 但增加了机械臂误差。
  • 真实机器人评估:进行了 60 次抓取试验,π₀.₅ 基线模型得分 4.0/4,优于总 MSE 更低的微调模型(3.75/4)和 HSR-SmolVLA(3.5/4)。
  • 关键发现:实际机器人表现的排序与离线的机械臂分组误差一致,而非总 MSE 或底座误差。
  • 结论:对于异构动作空间,分组误差比总 MSE 更能可靠地预测模型在真实机器人上的表现。