一眼看懂
封面预览
WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练
- WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练
- 解决现有 WAMs 中固定长度动作块与语言、视觉、动作三模态的时间尺度不匹配问题:语言描述语义事件,视觉通过连续场景动态演变,动作在控制级时间尺度操作
- 使用动作为中心的语义事件作为学习的原子单位,而非按外部时钟切割的固定长度块
Card 01
研究单位
研究单位
- X Square Robot Team(团队署名,论文以技术报告形式呈现)
Card 02
论文概述
论文概述
- WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练
- 解决现有 WAMs 中固定长度动作块与语言、视觉、动作三模态的时间尺度不匹配问题:语言描述语义事件,视觉通过连续场景动态演变,动作在控制级时间尺度操作
- 使用动作为中心的语义事件作为学习的原子单位,而非按外部时钟切割的固定长度块
Card 03
核心贡献
核心贡献
- 提出事件为中心的 WAM 预训练方法,以语义连贯的动作事件作为训练原子单位
- 设计两种互补推理模式:Event mode 支持可变长度执行片段,Unified mode 通过 VLM 的 Staircase Decoding 支持固定长度块推理
- 开发多视角视频建模技术:Camera RoPE 和 Cross-view Geometric Masking 增强跨视角几何一致性
- 构建 Muon-optimizer-based 大规模预训练基础设施,支持可扩展的 WAM 训练
- 在大规模真实世界泛化评估中取得 state-of-the-art 性能
Card 04
方法描述
方法描述
- 架构包含继承自 Wan Series text-to-video 模型的 Video Tower 和随机初始化的 Action DiT,通过 Layer-wise Coupling 连接
- Camera RoPE 为每个视角提供可学习的旋转身份,无需运行时标定即可支持多具身训练
- Cross-view Geometric Masking 包含 Sight-cone attention masking(基于视角锥体相交的注意力掩码)和 Tube patch masking(时空管状区域掩码)
- 视频侧使用 Wan-style v-prediction flow matching 目标,动作侧支持 v-prediction 和可选 x-prediction
- Staircase decoding 通过 VLM backbone 的交错深度注入潜在 CoT tokens,保持预训练视觉-语言先验
- Video-Action Timestep Mapping 采用 Asymmetric 1-to-Nd 映射,固定视频去噪锚点步骤支持完整动作调度
Card 05
数据集与资源
数据集与资源
- 使用事件为中心的数据生态系统,包含事件级标注和集群平衡采样
- 数据收集包含 UMI-style rig 设备采集的非具身数据和结构化/非结构化数据流
- 模型架构:Video Tower 继承 Wan 模型,Action DiT 深度与 Video Tower 相等
- 预训练基础设施基于 Muon optimizer,支持大规模分布式训练
Card 06
评估与结果
评估与结果
- 评估环境包括具身视频生成评估和真实机器人操作评估
- 真实机器人评估涵盖多样化操作、推理操作、灵巧操作和泛化性测试
- 主要指标包括操作任务成功率、视频生成质量指标
- 在大规模真实世界泛化评估中取得领先性能
- 消融实验验证事件建模和视角建模组件的有效性