返回列表
VLA / Vision-Language-Action 每日论文卡
World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
论文提出了一类新的具身基础模型——世界-语言-动作模型 (WLA),旨在统一世界建模、语言推理和动作合成。

论文详情

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

2026-06-04 · 原文 · 翻译 · 2606.05979

论文提出了一类新的具身基础模型——世界-语言-动作模型 (WLA),旨在统一世界建模、语言推理和动作合成。 WLA 解决了现有世界-动作模型 (WAM) 缺乏语义推理能力,以及视觉-语言-动作模型 (VLA) 无法有效建模物理动态的问题。 通过自回归 Transformer 骨干,模型同时预测文本子任务(高层意图)和物理动态(低层状态转移),并利用世界专家和动作专家实现高效的机器人控制。

6 分钟读完 6 张阅读卡 SJTU (上海交通大学)
一眼看懂 封面预览

论文提出了一类新的具身基础模型——世界-语言-动作模型 (WLA),旨在统一世界建模、语言推理和动作合成。

  • 论文提出了一类新的具身基础模型——世界-语言-动作模型 (WLA),旨在统一世界建模、语言推理和动作合成。
  • WLA 解决了现有世界-动作模型 (WAM) 缺乏语义推理能力,以及视觉-语言-动作模型 (VLA) 无法有效建模物理动态的问题。
  • 通过自回归 Transformer 骨干,模型同时预测文本子任务(高层意图)和物理动态(低层状态转移),并利用世界专家和动作专家实现高效的机器人控制。
Card 01 研究单位

研究单位

  • SJTU (上海交通大学)
  • SII (上海智能研究院)
  • HUST (华中科技大学)
  • SCUT (华南理工大学)
  • ECUST (华东理工大学)
  • SHU (上海大学)
  • NJUPT (南京邮电大学)
Card 02 论文概述

论文概述

  • 论文提出了一类新的具身基础模型——世界-语言-动作模型 (WLA),旨在统一世界建模、语言推理和动作合成。
  • WLA 解决了现有世界-动作模型 (WAM) 缺乏语义推理能力,以及视觉-语言-动作模型 (VLA) 无法有效建模物理动态的问题。
  • 通过自回归 Transformer 骨干,模型同时预测文本子任务(高层意图)和物理动态(低层状态转移),并利用世界专家和动作专家实现高效的机器人控制。
Card 03 核心贡献

核心贡献

  • 提出了 WLA 模型,首次将世界建模、语言推理和动作合成统一在一个框架中,并采用自回归 Transformer 而非双向扩散 Transformer 作为骨干。
  • 引入世界专家 (World Expert) 以隐式方式影响动作生成,推理时可完全禁用世界专家,实现约 40 ms 的低延迟推理。
  • 设计了测试时扩展 (TTS) 模式,通过价值模型对多个候选动作序列的未来状态进行评分,选择最优动作,提升机器人控制性能。
  • 在多个仿真和真实世界基准上取得 state-of-the-art 结果,包括 RoboTwin 2.0 (92.94% 成功率)、LIBERO (98.6% 平均成功率) 和 RMBench (56.5% 成功率)。
  • 展示了从无动作标注的跨具身机器人视频中学习新任务的能力,在未见任务上性能提升近 3 倍。
Card 04 方法描述

方法描述

  • WLA 以文本指令、当前和历史图像、机器人状态为输入,通过自回归 Transformer 骨干预测文本子任务、物理动态和动作序列。
  • 使用 meta-queries 从骨干提取物理动态,世界专家 (SANA-600M) 基于当前状态和动态预测未来帧,动作专家生成动作,两者通过流匹配损失优化。
  • 训练时联合优化文本生成损失、世界建模损失和动作损失,世界建模以隐式方式影响动作生成,推理时高效模式下完全丢弃世界专家。
  • 测试时扩展模式中,世界专家被激活,预测多个候选动作对应的未来帧,并由训练好的价值模型选择最高价值动作执行。
Card 05 数据集与资源

数据集与资源

  • 数据集:RoboTwin 2.0 (50 个双手任务)、LIBERO (Spatial, Object, Goal, Long 四个套件)、RMBench (长时记忆依赖任务)、真实世界自定义任务。
  • 模型规模:总参数 3.4B,激活参数 2B;骨干 RynnBrain-2B,世界专家 SANA-600M,动作专家 390M flow-matching head
  • 训练资源:DeepSpeed 分布式训练,AdamW 优化器,学习率余弦调度,批量大小 256,训练步数 30k–100k 步。推理在 NVIDIA RTX 5090 GPU 上完成。
Card 06 评估与结果

评估与结果

  • 评估基准:RoboTwin 2.0 (Clean/随机化)、LIBERO 四套件、RMBench 四个任务、真实世界四个长时任务 (标准、OOD 物体、OOD 场景)。
  • 主要指标:任务成功率、推理延迟、任务完成时间。
  • 关键结果:

- RoboTwin 2.0 Clean 成功率 92.94%,随机化 90.02%,与领先 WAM 持平且参数量更少。

- LIBERO 平均成功率 98.6%,超越所有 VLA 和 WAM 基线;开启 TTS 后提升至 98.9%。

- RMBench 平均成功率 56.5%,近乎最佳基线的 2 倍,展现强语言推理和记忆能力。

- 真实世界任务中,WLA-0 在动态 Dispose Trash 任务上成功率最高,推理延迟 ~40 ms,约为 Motus 的 1/40。

- 从视频学习新任务:加入未见任务同具身视频后,成功率从 13.0% 提升至 34.4%;跨具身视频也达到 28.8%,验证了跨具身迁移能力。