一眼看懂
封面预览
提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型
- 提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型
- 解决现有世界模型只能进行开环预测、无法支持闭环策略评估的问题,旨在降低真实机器人测试成本
- 通过交替执行 VLA 策略推理和世界模型预测,生成多轮未来观测,模拟真实机器人的闭环交互过程
Card 01
研究单位
研究单位
- Tongji University
- AIRC, Midea Group
Card 02
论文概述
论文概述
- 提出 PiL-World,一种用于视觉-语言-动作(VLA)策略闭环评估的分块式世界模型
- 解决现有世界模型只能进行开环预测、无法支持闭环策略评估的问题,旨在降低真实机器人测试成本
- 通过交替执行 VLA 策略推理和世界模型预测,生成多轮未来观测,模拟真实机器人的闭环交互过程
Card 03
核心贡献
核心贡献
- 引入 PiL-World,首个匹配 VLA 策略闭环评估接口的分块世界模型
- 集成动作-控制投影、潜在多视图历史记忆、联合多视图预测和成功/失败轨迹训练,显著提升闭环 rollout 的一致性
- 在三个真实双臂操作任务上验证,并提出幻觉自由比率(HFR)作为密集 rollout 可靠性的新指标
- 大幅缩小真实与想象成功率差距(从 63.2% 降至 12.0%),且跨检查点 Pearson 相关性达 0.94
Card 04
方法描述
方法描述
- 基于 Wan2.1-14B 视频生成模型初始化,先在 RealSource World 大规模数据集上预训练学习机器人动力学,再在目标任务上微调
- 动作-控制投影:将 VLA 预测的绝对关节空间动作转换为头部视图的视觉控制帧(标记夹爪位置和状态)
- 潜在历史记忆:编码最近多视图帧作为潜在条件,保持跨轮次的时序一致性,避免生成漂移
- 联合多视图预测:同步预测多个相机视角的未来观测,确保多视图一致性
- 训练时使用成功演示和失败遥操作轨迹混合数据,使模型能覆盖多样化执行结果
- 推理时,VLA 策略输出动作块,世界模型生成对应步长的未来帧,将终端帧反馈给策略,循环执行
Card 05
数据集与资源
数据集与资源
- 预训练数据集:RealSource World(包含 11,428 个 episode、超过 1400 万帧的 35 种双臂操作任务)
- 微调数据集:三个目标任务(Sort Cubes、Stack Bowls、Stack Blocks)的 100/100/200 条轨迹,含成功和失败样本
- 模型规模:基于 Wan2.1-14B(14B 参数),使用 LoRA 微调
- 训练资源:预训练使用 64 块 H20 GPU,微调使用 8 块 H20 GPU
Card 06
评估与结果
评估与结果
- 评估环境:三个真实双臂操作任务的子任务级闭环 rollout,与真实机器人执行结果配对比较
- 主要指标:真实-想象成功率差距(\|ΔSR\|)、幻觉自由比率(HFR)、单步 LPIPS(多视图感知相似度)
- 关键结果:
- 平均 \|ΔSR\|从 63.2% 降至 12.0%,HFR 从 41.5% 提升至 70.1%
- 单步 LPIPS 在所有任务上均优于基线 Ctrl-World,尤其在头部视图改善显著
- 跨 VLA 检查点(训练步数)的 Pearson 相关性达 0.94,表明想象 rollout 能可靠反映策略相对性能