返回列表
VLA / Vision-Language-Action 每日论文卡
TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models
提出 TTT-VLA,一个基于潜在提示优化的测试时训练框架,用于视觉-语言-动作模型

论文详情

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

2026-06-02 · 原文 · 翻译 · 2606.03127

提出 TTT-VLA,一个基于潜在提示优化的测试时训练框架,用于视觉-语言-动作模型 解决 VLA 模型在部署时因分布偏移导致性能下降的问题,通过优化一个可学习的潜在提示实现轻量级适配 无需修改策略主干网络,仅使用自监督信号在测试时从交互数据中学习,提升模型在新环境下的表现

5 分钟读完 6 张阅读卡 ByteDance Seed
一眼看懂 封面预览

提出 TTT-VLA,一个基于潜在提示优化的测试时训练框架,用于视觉-语言-动作模型

  • 提出 TTT-VLA,一个基于潜在提示优化的测试时训练框架,用于视觉-语言-动作模型
  • 解决 VLA 模型在部署时因分布偏移导致性能下降的问题,通过优化一个可学习的潜在提示实现轻量级适配
  • 无需修改策略主干网络,仅使用自监督信号在测试时从交互数据中学习,提升模型在新环境下的表现
Card 01 研究单位

研究单位

  • ByteDance Seed
  • The University of Adelaide
  • Tsinghua University
  • Zhejiang University
  • The University of Hong Kong
  • CSIRO Data61
Card 02 论文概述

论文概述

  • 提出 TTT-VLA,一个基于潜在提示优化的测试时训练框架,用于视觉-语言-动作模型
  • 解决 VLA 模型在部署时因分布偏移导致性能下降的问题,通过优化一个可学习的潜在提示实现轻量级适配
  • 无需修改策略主干网络,仅使用自监督信号在测试时从交互数据中学习,提升模型在新环境下的表现
Card 03 核心贡献

核心贡献

  • 提出 TTT-VLA 框架,首次系统性地探索在 VLA 模型上通过仅优化潜在提示进行测试时训练
  • 单体现多体现设置下均实现持续的性能提升,验证了潜在提示作为适配接口的有效性
  • 发现并定义了关键决策转向现象,揭示测试时训练的增益主要来自纠正少量关键动作,而非全局改变策略行为
  • 设计了有效的训练策略,包括两阶段训练和随机丢弃机制,确保潜在提示在单体现设置中仍能学习到控制相关上下文
Card 04 方法描述

方法描述

  • 基于 Mixture-of-Transformers 架构,包含动作专家和状态基础专家,从预训练 π₀.₅ 模型初始化
  • 引入潜在提示作为可学习的令牌块,通过状态基础代理任务进行优化,该任务预测机器人末端执行器位置和夹爪状态
  • 训练时联合优化动作损失和代理损失,测试时冻结策略主干,仅使用交互数据更新潜在提示
  • 单体现设置采用两阶段训练策略:第一阶段阻断潜在提示到动作专家的连接,第二阶段以 0.5 概率随机丢弃,强制解耦
Card 05 数据集与资源

数据集与资源

  • 评估基准:SimplerEnv,包含 WidowXGoogle Robot 任务
  • 单体现训练数据:BridgeData V2;多体现训练数据:OXE-Aug Bridge V2,包含 9 种机器人体现
  • 模型基于 π₀.₅,参数量级未明确说明,但属于大规模 VLA 模型
  • 训练使用 32 个 NVIDIA H100 GPU,单次训练约 20 小时;测试时训练使用 8 个 H100 GPU,约 15-30 分钟
Card 06 评估与结果

评估与结果

  • 评估协议:遵循 SimplerEnv 官方标准,WidowX 任务每任务评估 200 集以降低方差,Google Robot 任务使用默认评估次数
  • 主要评估指标:任务成功率
  • 关键实验结果:在 WidowX 单体现任务上,TTT-VLA 将成功率从 51.1% 提升至 67.4%;在 Google Robot 视觉匹配协议上从 67.5% 提升至 72.4%;在多体现设置下从 22.8% 提升至 31.6%
  • 分析表明,测试时训练的增益主要来自在关键决策点纠正错误动作,而非全局轨迹重写,且离线批量更新比在线更新更稳定