返回列表
VLA / Vision-Language-Action 每日论文卡
Completion at the Boundary (CaB): Deployable Switching with Completion-Aware Control under Limited Calibration
针对 VLA(视觉-语言-动作)代理在复合指令中缺乏显式完成接口的问题,研究在有限校准条件下如何做出可部署的切换决策。

论文详情

Completion at the Boundary (CaB): Deployable Switching with Completion-Aware Control under Limited Calibration

2026-05-29 · 原文 · 翻译 · 2606.00145

针对 VLA(视觉-语言-动作)代理在复合指令中缺乏显式完成接口的问题,研究在有限校准条件下如何做出可部署的切换决策。 提出 Completion at the Boundary (CaB),通过预测一个事件局部的边界相位后验(Before/Hit/After),同时用于切换决策(CaB-When)和边界稳定控制(CaB-How)。 在 Minecraft 第一人称 VLA 基准上,通过干预感知的 E1/E2 协议验证了 CaB 在复合任务执行和切换质量上的提升。

6 分钟读完 6 张阅读卡 Intelligent Systems Laboratory, SECOM Co., Ltd.
一眼看懂 封面预览

针对 VLA(视觉-语言-动作)代理在复合指令中缺乏显式完成接口的问题,研究在有限校准条件下如何做出可部署的切换决策。

  • 针对 VLA(视觉-语言-动作)代理在复合指令中缺乏显式完成接口的问题,研究在有限校准条件下如何做出可部署的切换决策。
  • 提出 Completion at the Boundary (CaB),通过预测一个事件局部的边界相位后验(Before/Hit/After),同时用于切换决策(CaB-When)和边界稳定控制(CaB-How)。
  • 在 Minecraft 第一人称 VLA 基准上,通过干预感知的 E1/E2 协议验证了 CaB 在复合任务执行和切换质量上的提升。
Card 01 研究单位

研究单位

  • Intelligent Systems Laboratory, SECOM Co., Ltd.
Card 02 论文概述

论文概述

  • 针对 VLA(视觉-语言-动作)代理在复合指令中缺乏显式完成接口的问题,研究在有限校准条件下如何做出可部署的切换决策。
  • 提出 Completion at the Boundary (CaB),通过预测一个事件局部的边界相位后验(Before/Hit/After),同时用于切换决策(CaB-When)和边界稳定控制(CaB-How)。
  • 在 Minecraft 第一人称 VLA 基准上,通过干预感知的 E1/E2 协议验证了 CaB 在复合任务执行和切换质量上的提升。
Card 03 核心贡献

核心贡献

  • 一个双用途的完成对象:引入边界相位令牌(BPT)的在线后验,保留双向边界证据,同时用于切换接口(*when*)和完成感知控制(*how*)。
  • CaB 框架:提出 CaB-When 和 CaB-How 两个消费者共享同一 BPT 后验,CaB-When 在部署约束下决定何时切换,CaB-How 则复用该后验以条件化动作生成,实现边界稳定。
  • 干预感知评估协议与实证验证:设计 E1/E2 协议分离动作检测与闭环执行,并通过 When×How 分解分析贡献;在 Minecraft 环境下验证了 CaB 在匹配部署约束下的有效性。
Card 04 方法描述

方法描述

  • 边界相位令牌(BPT):将每个子指令的首次成功事件离散化为 Before/Hit/After 三类,形成一个事件局部窗口内的后验分布,保留双向边界证据。
  • CaB-When:通过固定线性读出(三角核)将 BPT 后验转换为标量完成证据得分,再使用学习无关的短时聚合和单一全局阈值 (θ, L) 作出切换决策,阈值仅在开发集上校准,测试时冻结。
  • CaB-How:采用 BPT-动作因子分解,在同一自回归模型内先预测 BPT 令牌,再条件化于该令牌生成动作,利用单向掩码防止反向泄漏,实现边界稳定的控制。
  • 训练时联合优化 BPT 预测和动作预测的交叉熵损失,推理时共享同一后验,通过固定读出具现切换接口,同时采样 BPT 令牌用于动作条件化。
Card 05 数据集与资源

数据集与资源

  • 数据集VPT Demonstration Dataset(包含 Minecraft 人类演示数据)
  • 模型骨干PaliGemma-3B(视觉-语言模型)
  • 训练资源:2× RTX 6000 Ada GPU,训练 10 天
  • 评估环境:第一人称 Minecraft VLA 环境,动作空间为键盘/鼠标离散控制
Card 06 评估与结果

评估与结果

  • 评估协议:E1(动作固定检测)和 E2(闭环执行)分离评估;单一全局阈值 (θ, L) 仅在开发集校准,测试时冻结。
  • 主要指标:E1 的 Completion-F1、False Completion 率、最坏情况 E1 遗憾;E2 的单任务和复合任务成功率、过早切换率、过晚切换率、手递质量 SR₂\|₁。
  • 关键结果

- CaB-When 在 E1 上获得 Completion-F1 90.3(基线最高 79.5),False Completion 降至 13.8%,且最坏情况 E1 遗憾仅为 5.8(其他基线 31.9–45.3),表现出跨任务组的鲁棒性。

- CaB (When+How) 在 E2 上获得复合任务成功率 12.6(基线最高 9.1),单任务成功率 61.1(显著高于其他)。

- 分解实验显示,完成驱动切换(CD)大幅减少过晚切换(92.5→4.5),而 How-ON 在固定切换时提升手递质量(SR₂\|₁ 从 8.7 到 12.7),两者结合获得最佳复合成功率。