返回列表
VLA / Vision-Language-Action 每日论文卡
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
提出了 DeMaVLA,一个用于可泛化可变形物体操作的视觉-语言-动作(VLA)基础模型

论文详情

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

2026-05-29 · 原文 · 翻译 · 2605.31286

提出了 DeMaVLA,一个用于可泛化可变形物体操作的视觉-语言-动作(VLA)基础模型 解决了现有VLA系统为不同物体类别训练单独策略或多任务训练存在任务干扰的问题 目标是实现一个统一的、单检查点的策略,以处理多类别的衣物折叠任务及随机初始状态

4 分钟读完 6 张阅读卡 AIRC, Midea Group
一眼看懂 封面预览

提出了 DeMaVLA,一个用于可泛化可变形物体操作的视觉-语言-动作(VLA)基础模型

  • 提出了 DeMaVLA,一个用于可泛化可变形物体操作的视觉-语言-动作(VLA)基础模型
  • 解决了现有VLA系统为不同物体类别训练单独策略或多任务训练存在任务干扰的问题
  • 目标是实现一个统一的、单检查点的策略,以处理多类别的衣物折叠任务及随机初始状态
Card 01 研究单位

研究单位

  • AIRC, Midea Group
  • Tongji University
Card 02 论文概述

论文概述

  • 提出了 DeMaVLA,一个用于可泛化可变形物体操作的视觉-语言-动作(VLA)基础模型
  • 解决了现有VLA系统为不同物体类别训练单独策略或多任务训练存在任务干扰的问题
  • 目标是实现一个统一的、单检查点的策略,以处理多类别的衣物折叠任务及随机初始状态
Card 03 核心贡献

核心贡献

  • 提出了包含LLM骨干、层对齐修剪动作专家、流匹配动作生成及训练时RTC的VLA架构设计
  • 证明了大规模真实世界预训练对可变形物体操作的重要性,利用约5000小时双臂演示数据
  • 通过人机交互DAgger管道收集纠正数据,直接针对统一模型的失败模式进行改进
  • 在仿真基准和真实世界家庭折叠任务上均取得了强劲的性能表现
Card 04 方法描述

方法描述

  • 模型基于 Qwen3-VL 骨干网络,引入动作专家处理机器人本体感受和连续动作预测
  • 采用 层对齐修剪 技术,每隔一层修剪Transformer层,在保留层级对齐的同时降低计算成本
  • 使用 流匹配 生成连续动作块,适合长视距双臂平滑控制
  • 结合 训练时RTC 模拟推理延迟,实现异步动作块执行
  • 通过 人机交互DAgger 在真实机器人上收集纠正轨迹,聚焦策略失败状态
Card 05 数据集与资源

数据集与资源

  • 预训练数据集包含约 5,000小时 的真实世界双臂人形操作演示
  • 模型总参数量为 6.6B,其中视觉编码器0.4B,基础语言模型4.0B,动作专家2.2B
  • 混合折叠数据包含37小时真实机器人数据,覆盖衬衫、裙子、裤子、毛巾四类任务
Card 06 评估与结果

评估与结果

  • 评估基准包括 RoboTwin 模拟基准(50项双臂任务)和真实世界家庭折叠基准
  • 在RoboTwin上,DeMaVLA在干净设置下达到 88.42% 成功率,随机化设置下达到 86.78%
  • 在真实世界折叠基准上,DeMaVLA多任务平均成功率为 92.5%,显著优于基线π₀的76.3%
  • 单任务衬衫折叠成功率达到 100.0%,平均完成时间2:04,优于基线π₀
  • 预训练规模分析显示,从500小时增加到5,000小时,成功率从55.0%提升至100.0%