返回列表
VLA / Vision-Language-Action 每日论文卡
MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action
提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题

论文详情

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

2026-06-04 · 原文 · 翻译 · 2606.06245

提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题 针对现有VLA策略在复杂任务中推理时间不足、显式思维链推理引入高延迟和文本-动作间接接口的痛点 通过在潜在空间中初始化多条假设、迭代优化并软性聚合,实现测试时可扩展的推理,而不改变原有动作解码接口

5 分钟读完 6 张阅读卡 Boston University (Department of Electrical and Com…
一眼看懂 封面预览

提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题

  • 提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题
  • 针对现有VLA策略在复杂任务中推理时间不足、显式思维链推理引入高延迟和文本-动作间接接口的痛点
  • 通过在潜在空间中初始化多条假设、迭代优化并软性聚合,实现测试时可扩展的推理,而不改变原有动作解码接口
Card 01 研究单位

研究单位

  • Boston University (Department of Electrical and Computer Engineering)
  • Tsinghua University (Department of Computer Science)
Card 02 论文概述

论文概述

  • 提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题
  • 针对现有VLA策略在复杂任务中推理时间不足、显式思维链推理引入高延迟和文本-动作间接接口的痛点
  • 通过在潜在空间中初始化多条假设、迭代优化并软性聚合,实现测试时可扩展的推理,而不改变原有动作解码接口
Card 03 核心贡献

核心贡献

  • 将VLA推理问题形式化为测试时计算资源分配问题,在显式高成本推理与浅层单次控制之间寻求平衡
  • 提出 MPCoT 模块,引入权重共享的多步潜在优化(深度 K)和多路径假设(宽度 M),不产生推理令牌,且保持原有动作接口不变
  • 提出训练期奖励引导的路径偏好学习方法,利用动作一致性、世界模型/VLM进度评估和成功反馈来对齐潜在路径评分器与下游执行质量
  • LIBEROCALVIN 基准上验证了方法有效性,通过消融实验证实了深度-宽度协同效应、置信度加权聚合和奖励监督路径偏好的作用
Card 04 方法描述

方法描述

  • 多路径潜在推理:从共享的感知-语言上下文初始化 M 个潜在假设,通过权重共享的残差MLP进行 K 步迭代优化,形成多路径潜在控制假设
  • 软性聚合与评分:利用轻量级评分器对每条路径打分,输出软性选择概率,并以此概率加权聚合所有路径,再送入不变的策略解码器生成动作
  • 训练期奖励引导:在训练时,将每条路径解码为候选动作,使用专家动作一致性、世界模型/VLM进度评估和成功标签计算复合奖励,以优势加权方式训练路径评分器,推理时无需任何奖励或额外评估器
  • 端到端训练:结合行为克隆损失、奖励引导路径偏好损失和多样性正则化损失联合训练,多样性正则化防止路径坍塌
Card 05 数据集与资源

数据集与资源

  • 使用的数据集:LIBERO(四个子集:Spatial、Object、Goal、Long)和 CALVIN ABC→D(训练于A/B/C环境,测试于D环境)
  • 模型主干:基于 OpenVLA-OFT,MPCoT模块仅增加约 2.7% 参数
  • 训练资源:训练和评估遵循OpenVLA-OFT标准设定,推理时使用固定配置( K=5, M=4 ),延迟约38ms
Card 06 评估与结果

评估与结果

  • 评估基准:LIBERO 四套件成功率、CALVIN ABC→D 1-5步成功率及平均序列长度
  • 主要评估指标:成功率(SR)、路径一致性(Path Consistency)、路径相似度与稳定性
  • 关键实验结果:

- 在LIBERO多套件设置中,MPCoT将OpenVLA-OFT的平均成功率从96.8%提升至 98.9%,长时域成功率从95.3%提升至 98.9%

- 在CALVIN ABC→D上,4步/5步成功率分别达到 93.7%/89.4%,较基础模型提升超过13个百分点,验证了长时域执行优势

- 深度-宽度消融表明,增加深度和宽度可互补提升性能,最佳配置( K=5, M=4 )达到最优

- 奖励引导路径偏好学习将路径一致性从68.5%提升至 84.3%,并显著改善长时域指标,且推理延迟远低于显式文本CoT方案