返回列表
VLA / Vision-Language-Action 每日论文卡
WALL-WM: Carving World Action Modeling at the Event Joints
WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练

论文详情

WALL-WM: Carving World Action Modeling at the Event Joints

2026-06-01 · 原文 · 翻译 · 2606.01955

WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练 解决现有 WAMs 中固定长度动作块与语言、视觉、动作三模态的时间尺度不匹配问题:语言描述语义事件,视觉通过连续场景动态演变,动作在控制级时间尺度操作 使用动作为中心的语义事件作为学习的原子单位,而非按外部时钟切割的固定长度块

5 分钟读完 6 张阅读卡 X Square Robot Team(团队署名,论文以技术报告形式呈现)
一眼看懂 封面预览

WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练

  • WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练
  • 解决现有 WAMs 中固定长度动作块与语言、视觉、动作三模态的时间尺度不匹配问题:语言描述语义事件,视觉通过连续场景动态演变,动作在控制级时间尺度操作
  • 使用动作为中心的语义事件作为学习的原子单位,而非按外部时钟切割的固定长度块
Card 01 研究单位

研究单位

  • X Square Robot Team(团队署名,论文以技术报告形式呈现)
Card 02 论文概述

论文概述

  • WALL-WM 是一个 World Action Model,将视频-动作学习从块中心优化转变为事件中心的 Vision-Language-Action 预训练
  • 解决现有 WAMs 中固定长度动作块与语言、视觉、动作三模态的时间尺度不匹配问题:语言描述语义事件,视觉通过连续场景动态演变,动作在控制级时间尺度操作
  • 使用动作为中心的语义事件作为学习的原子单位,而非按外部时钟切割的固定长度块
Card 03 核心贡献

核心贡献

  • 提出事件为中心的 WAM 预训练方法,以语义连贯的动作事件作为训练原子单位
  • 设计两种互补推理模式:Event mode 支持可变长度执行片段,Unified mode 通过 VLM 的 Staircase Decoding 支持固定长度块推理
  • 开发多视角视频建模技术:Camera RoPE 和 Cross-view Geometric Masking 增强跨视角几何一致性
  • 构建 Muon-optimizer-based 大规模预训练基础设施,支持可扩展的 WAM 训练
  • 在大规模真实世界泛化评估中取得 state-of-the-art 性能
Card 04 方法描述

方法描述

  • 架构包含继承自 Wan Series text-to-video 模型的 Video Tower 和随机初始化的 Action DiT,通过 Layer-wise Coupling 连接
  • Camera RoPE 为每个视角提供可学习的旋转身份,无需运行时标定即可支持多具身训练
  • Cross-view Geometric Masking 包含 Sight-cone attention masking(基于视角锥体相交的注意力掩码)和 Tube patch masking(时空管状区域掩码)
  • 视频侧使用 Wan-style v-prediction flow matching 目标,动作侧支持 v-prediction 和可选 x-prediction
  • Staircase decoding 通过 VLM backbone 的交错深度注入潜在 CoT tokens,保持预训练视觉-语言先验
  • Video-Action Timestep Mapping 采用 Asymmetric 1-to-Nd 映射,固定视频去噪锚点步骤支持完整动作调度
Card 05 数据集与资源

数据集与资源

  • 使用事件为中心的数据生态系统,包含事件级标注和集群平衡采样
  • 数据收集包含 UMI-style rig 设备采集的非具身数据和结构化/非结构化数据流
  • 模型架构:Video Tower 继承 Wan 模型,Action DiT 深度与 Video Tower 相等
  • 预训练基础设施基于 Muon optimizer,支持大规模分布式训练
Card 06 评估与结果

评估与结果

  • 评估环境包括具身视频生成评估和真实机器人操作评估
  • 真实机器人评估涵盖多样化操作、推理操作、灵巧操作和泛化性测试
  • 主要指标包括操作任务成功率、视频生成质量指标
  • 在大规模真实世界泛化评估中取得领先性能
  • 消融实验验证事件建模和视角建模组件的有效性