返回列表
VLA / Vision-Language-Action 每日论文卡
See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs
提出 S2 (See Less, Specify More) 框架,旨在解决视觉-语言-动作(VLA)模型在泛化过程中面临的视觉干扰和指令歧义问题

论文详情

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs

2026-06-01 · 原文 · 翻译 · 2606.02735

提出 S2 (See Less, Specify More) 框架,旨在解决视觉-语言-动作(VLA)模型在泛化过程中面临的视觉干扰和指令歧义问题 核心思想是通过减少视觉证据(See Less)和增强语言规范(Specify More)来缩小执行器的学习问题空间,从而提升泛化能力 目标是在模块化的规划器-执行器架构中,为执行器构建一个更清晰的调节接口,使其能专注于执行而非从弱监督中恢复意图

5 分钟读完 6 张阅读卡 论文作者未明确列出所属机构,但从论文内容可推断作者来自Airoa(对应作者邮箱 kris.wu@air…
一眼看懂 封面预览

提出 S2 (See Less, Specify More) 框架,旨在解决视觉-语言-动作(VLA)模型在泛化过程中面临的视觉干扰和指令歧义问题

  • 提出 S2 (See Less, Specify More) 框架,旨在解决视觉-语言-动作(VLA)模型在泛化过程中面临的视觉干扰和指令歧义问题
  • 核心思想是通过减少视觉证据(See Less)和增强语言规范(Specify More)来缩小执行器的学习问题空间,从而提升泛化能力
  • 目标是在模块化的规划器-执行器架构中,为执行器构建一个更清晰的调节接口,使其能专注于执行而非从弱监督中恢复意图
Card 01 研究单位

研究单位

  • 论文作者未明确列出所属机构,但从论文内容可推断作者来自Airoa(对应作者邮箱 kris.wu@airoa.org)
Card 02 论文概述

论文概述

  • 提出 S2 (See Less, Specify More) 框架,旨在解决视觉-语言-动作(VLA)模型在泛化过程中面临的视觉干扰和指令歧义问题
  • 核心思想是通过减少视觉证据(See Less)和增强语言规范(Specify More)来缩小执行器的学习问题空间,从而提升泛化能力
  • 目标是在模块化的规划器-执行器架构中,为执行器构建一个更清晰的调节接口,使其能专注于执行而非从弱监督中恢复意图
Card 03 核心贡献

核心贡献

  • 提出目标保留的分层重标注机制(Specify More),将粗糙任务指令细化为轨迹级和子任务级局部语言指导,同时保留原始任务目标以消除执行歧义
  • 提出控制驱动的视觉证据预算(See Less),通过轻量级门控网络从控制目标中学习任务相关的视觉证据,无需人工标注区域、框或掩码
  • 将VLA泛化问题重新定义为执行器调节接口设计问题,并证明该接口可兼容可插拔的现成VLM规划器
  • LIBERO-PRO、CALVIN和两个真实机器人平台(TX-G2、HSR)上验证了方案的有效性,在真实机器人任务上将平均子任务成功率从54.2%提升至79.0%
Card 04 方法描述

方法描述

  • Specify More:利用现成的VLM,基于原始指令和代表性图像,为轨迹生成保持目标一致性的精细指令和有序子任务序列,并时间对齐到具体帧,构建层次化语言调节接口
  • See Less:在视觉Token上引入软掩码,由轻量MLP门控网络根据当前语言上下文和视觉Token预测保留权重,并通过视觉证据预算正则项控制平均保留量,与任务损失联合优化以学习控制相关的证据
  • 策略学习:采用无门控路径门控路径双分支设计,无门控路径保留完整观测以稳定训练,门控路径施加视觉证据约束,结合预算正则化形成联合训练目标
Card 05 数据集与资源

数据集与资源

  • 使用的数据集:LIBERO-10、LIBERO-Goal、LIBERO-Object、LIBERO-Spatial(模拟基准);TX-G2HSR(真实机器人数据集)
  • 模型骨干:基于π0.5(pi05_base)的流匹配模型,并添加了门控头
  • 使用的VLM:默认使用Kimi K2.5进行指令重标注和推理规划,也测试了GPT-5.4 nano等
  • 训练资源:未明确详述,但涉及多GPU训练(A100 80GB)
Card 06 评估与结果

评估与结果

  • 评估基准:LIBERO-PRO(对象、位置、语义、任务四个扰动维度)、CALVIN ABC→DTX-G2HSR真实机器人任务
  • 主要评估指标:任务成功率(%)、子任务成功率(%)
  • 关键实验结果:

- 在LIBERO-PRO的多个扰动维度上,S2(GPT-5.4 nano)在所有子类别上均显著优于OpenVLA-OFT、X-VLA、VLA-Adapter等基线方法

- 在真实机器人TX-G2平台上,S2相对基线π0.5将平均子任务成功率从54.2%提升至79.0%

- 在CALVIN ABC→D长时程任务上,S2成功率达到42.4%,远高于基线的8.2%

- 视觉证据预算对干扰物具有强鲁棒性,在杂乱场景下成功率仅小幅下降