一眼看懂
封面预览
提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题
- 提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题
- 针对现有VLA策略在复杂任务中推理时间不足、显式思维链推理引入高延迟和文本-动作间接接口的痛点
- 通过在潜在空间中初始化多条假设、迭代优化并软性聚合,实现测试时可扩展的推理,而不改变原有动作解码接口
Card 01
研究单位
研究单位
- Boston University (Department of Electrical and Computer Engineering)
- Tsinghua University (Department of Computer Science)
Card 02
论文概述
论文概述
- 提出 MPCoT,一个面向视觉-语言-动作(VLA)模型的奖励引导多路径潜在推理框架,旨在解决长时域、高不确定性机器人控制中的推理深度与效率问题
- 针对现有VLA策略在复杂任务中推理时间不足、显式思维链推理引入高延迟和文本-动作间接接口的痛点
- 通过在潜在空间中初始化多条假设、迭代优化并软性聚合,实现测试时可扩展的推理,而不改变原有动作解码接口
Card 03
核心贡献
核心贡献
- 将VLA推理问题形式化为测试时计算资源分配问题,在显式高成本推理与浅层单次控制之间寻求平衡
- 提出 MPCoT 模块,引入权重共享的多步潜在优化(深度 K)和多路径假设(宽度 M),不产生推理令牌,且保持原有动作接口不变
- 提出训练期奖励引导的路径偏好学习方法,利用动作一致性、世界模型/VLM进度评估和成功反馈来对齐潜在路径评分器与下游执行质量
- 在 LIBERO 和 CALVIN 基准上验证了方法有效性,通过消融实验证实了深度-宽度协同效应、置信度加权聚合和奖励监督路径偏好的作用
Card 04
方法描述
方法描述
- 多路径潜在推理:从共享的感知-语言上下文初始化 M 个潜在假设,通过权重共享的残差MLP进行 K 步迭代优化,形成多路径潜在控制假设
- 软性聚合与评分:利用轻量级评分器对每条路径打分,输出软性选择概率,并以此概率加权聚合所有路径,再送入不变的策略解码器生成动作
- 训练期奖励引导:在训练时,将每条路径解码为候选动作,使用专家动作一致性、世界模型/VLM进度评估和成功标签计算复合奖励,以优势加权方式训练路径评分器,推理时无需任何奖励或额外评估器
- 端到端训练:结合行为克隆损失、奖励引导路径偏好损失和多样性正则化损失联合训练,多样性正则化防止路径坍塌
Card 05
数据集与资源
数据集与资源
- 使用的数据集:LIBERO(四个子集:Spatial、Object、Goal、Long)和 CALVIN ABC→D(训练于A/B/C环境,测试于D环境)
- 模型主干:基于 OpenVLA-OFT,MPCoT模块仅增加约 2.7% 参数
- 训练资源:训练和评估遵循OpenVLA-OFT标准设定,推理时使用固定配置( K=5, M=4 ),延迟约38ms
Card 06
评估与结果
评估与结果
- 评估基准:LIBERO 四套件成功率、CALVIN ABC→D 1-5步成功率及平均序列长度
- 主要评估指标:成功率(SR)、路径一致性(Path Consistency)、路径相似度与稳定性
- 关键实验结果:
- 在LIBERO多套件设置中,MPCoT将OpenVLA-OFT的平均成功率从96.8%提升至 98.9%,长时域成功率从95.3%提升至 98.9%
- 在CALVIN ABC→D上,4步/5步成功率分别达到 93.7%/89.4%,较基础模型提升超过13个百分点,验证了长时域执行优势
- 深度-宽度消融表明,增加深度和宽度可互补提升性能,最佳配置( K=5, M=4 )达到最优
- 奖励引导路径偏好学习将路径一致性从68.5%提升至 84.3%,并显著改善长时域指标,且推理延迟远低于显式文本CoT方案