返回列表
VLA / Vision-Language-Action 每日论文卡
PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation
提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型

论文详情

PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation

2026-06-04 · 原文 · 翻译 · 2606.05773

提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型 解决现有世界模型只能进行开环预测、无法支持闭环策略评估的问题,旨在降低真实机器人测试成本 通过交替执行 VLA 策略推理和世界模型预测,生成多轮未来观测,模拟真实机器人的闭环交互过程

5 分钟读完 6 张阅读卡 Tongji University
一眼看懂 封面预览

提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型

  • 提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型
  • 解决现有世界模型只能进行开环预测、无法支持闭环策略评估的问题,旨在降低真实机器人测试成本
  • 通过交替执行 VLA 策略推理和世界模型预测,生成多轮未来观测,模拟真实机器人的闭环交互过程
Card 01 研究单位

研究单位

  • Tongji University
  • AIRC, Midea Group
Card 02 论文概述

论文概述

  • 提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型
  • 解决现有世界模型只能进行开环预测、无法支持闭环策略评估的问题,旨在降低真实机器人测试成本
  • 通过交替执行 VLA 策略推理和世界模型预测,生成多轮未来观测,模拟真实机器人的闭环交互过程
Card 03 核心贡献

核心贡献

  • 引入 PiL-World,首个匹配 VLA 策略闭环评估接口的分块世界模型
  • 集成动作-控制投影潜在多视图历史记忆联合多视图预测成功/失败轨迹训练,显著提升闭环 rollout 的一致性
  • 在三个真实双臂操作任务上验证,并提出幻觉自由比率(HFR)作为密集 rollout 可靠性的新指标
  • 大幅缩小真实与想象成功率差距(从 63.2% 降至 12.0%),且跨检查点 Pearson 相关性达 0.94
Card 04 方法描述

方法描述

  • 基于 Wan2.1-14B 视频生成模型初始化,先在 RealSource World 大规模数据集上预训练学习机器人动力学,再在目标任务上微调
  • 动作-控制投影:将 VLA 预测的绝对关节空间动作转换为头部视图的视觉控制帧(标记夹爪位置和状态)
  • 潜在历史记忆:编码最近多视图帧作为潜在条件,保持跨轮次的时序一致性,避免生成漂移
  • 联合多视图预测:同步预测多个相机视角的未来观测,确保多视图一致性
  • 训练时使用成功演示和失败遥操作轨迹混合数据,使模型能覆盖多样化执行结果
  • 推理时,VLA 策略输出动作块,世界模型生成对应步长的未来帧,将终端帧反馈给策略,循环执行
Card 05 数据集与资源

数据集与资源

  • 预训练数据集:RealSource World(包含 11,428 个 episode、超过 1400 万帧的 35 种双臂操作任务)
  • 微调数据集:三个目标任务(Sort CubesStack BowlsStack Blocks)的 100/100/200 条轨迹,含成功和失败样本
  • 模型规模:基于 Wan2.1-14B(14B 参数),使用 LoRA 微调
  • 训练资源:预训练使用 64 块 H20 GPU,微调使用 8 块 H20 GPU
Card 06 评估与结果

评估与结果

  • 评估环境:三个真实双臂操作任务的子任务级闭环 rollout,与真实机器人执行结果配对比较
  • 主要指标:真实-想象成功率差距(\|ΔSR\|)幻觉自由比率(HFR)单步 LPIPS(多视图感知相似度)
  • 关键结果:

- 平均 \|ΔSR\|从 63.2% 降至 12.0%,HFR 从 41.5% 提升至 70.1%

- 单步 LPIPS 在所有任务上均优于基线 Ctrl-World,尤其在头部视图改善显著

- 跨 VLA 检查点(训练步数)的 Pearson 相关性达 0.94,表明想象 rollout 能可靠反映策略相对性能