返回列表
VLA / Vision-Language-Action 每日论文卡
Closed-Loop Neural Activation Control in Vision-Language-Action Models
提出了 CTRL-STEER 框架,用于在测试时对 Vision-Language-Action (VLA) 模型进行闭环引导,解决了现有开环方法因固定系数导致的过度修正和任务成功率下降问题。

论文详情

Closed-Loop Neural Activation Control in Vision-Language-Action Models

2026-05-29 · 原文 · 翻译 · 2606.00269

提出了 CTRL-STEER 框架,用于在测试时对 Vision-Language-Action (VLA) 模型进行闭环引导,解决了现有开环方法因固定系数导致的过度修正和任务成功率下降问题。 该方法将激活引导建模为一个闭环控制问题,通过自适应控制信号动态调节神经元激活强度,以平衡概念引导(如速度、高度)与任务执行的稳定性。 核心思想是将表示与调节解耦:在运动对齐的残差方向上进行引导,同时利用反馈控制器在线调整干预幅度,无需修改或重新训练基础模型。

6 分钟读完 6 张阅读卡 Florida International University
一眼看懂 封面预览

提出了 CTRL-STEER 框架,用于在测试时对 Vision-Language-Action (VLA) 模型进行闭环引导,解决了现有开环方法因固定系数导致的过度修正和任务成功率下降问题。

  • 提出了 CTRL-STEER 框架,用于在测试时对 Vision-Language-Action (VLA) 模型进行闭环引导,解决了现有开环方法因固定系数导致的过度修正和任务成功率下降问题。
  • 该方法将激活引导建模为一个闭环控制问题,通过自适应控制信号动态调节神经元激活强度,以平衡概念引导(如速度、高度)与任务执行的稳定性。
  • 核心思想是将表示与调节解耦:在运动对齐的残差方向上进行引导,同时利用反馈控制器在线调整干预幅度,无需修改或重新训练基础模型。
Card 01 研究单位

研究单位

  • Florida International University
  • SRI International
  • United States Military Academy
  • Oak Ridge National Laboratory
  • University of Florida
Card 02 论文概述

论文概述

  • 提出了 CTRL-STEER 框架,用于在测试时对 Vision-Language-Action (VLA) 模型进行闭环引导,解决了现有开环方法因固定系数导致的过度修正和任务成功率下降问题。
  • 该方法将激活引导建模为一个闭环控制问题,通过自适应控制信号动态调节神经元激活强度,以平衡概念引导(如速度、高度)与任务执行的稳定性。
  • 核心思想是将表示与调节解耦:在运动对齐的残差方向上进行引导,同时利用反馈控制器在线调整干预幅度,无需修改或重新训练基础模型。
Card 03 核心贡献

核心贡献

  • 闭环引导框架:首次将 VLA 模型的激活引导形式化为闭环控制问题,替代了传统的静态系数开环干预策略。
  • 基于 PID 的控制器:引入 PID 控制器,利用误差的比例、积分和微分项动态调整神经元激活,有效抑制了引导过程中的振荡和偏差。
  • 基于 RL 的控制器:提出基于 PPO 的强化学习控制器,通过联合优化引导合规性和任务成功率的奖励函数,实现了长期任务规划与非线性控制。
  • 神经元选择机制改进:扩展了机制可解释性方法,通过匹配语义特征集合(如运动概念组)而非单一特征来识别候选神经元,并进行多义性过滤。
Card 04 方法描述

方法描述

  • 神经元识别:通过将 FFN 层的值向量投影到词汇表空间,计算其语义嵌入,并使用 k-NN 搜索将其与代表控制概念的令牌集(如 up, down, forward 等)进行匹配,筛选出语义一致性最高的神经元。
  • PID 控制:根据当前引导误差(如实际高度与目标高度的差值)计算时变引导系数,利用比例项修正瞬时误差,积分项消除累积偏差,微分项抑制震荡。
  • RL 控制:将神经元激活状态、历史引导信号和任务进度作为输入状态,训练 PPO 策略网络输出引导系数向量,初始化自 PID 控制器并进一步通过环境交互优化。
  • 执行流程:在推理过程中,控制器根据环境反馈实时计算引导系数,对选定的神经元激活进行干预,从而生成满足特定运动属性且保证任务成功的动作序列。
Card 05 数据集与资源

数据集与资源

  • LIBERO 基准测试(包含 Goal, Object, Spatial, Long 四个任务套件)
  • BridgeData V2 数据集(通过 SimplerEnv 进行评估)
  • 基础模型为 OpenVLA(7B 参数量,基于 LLaMA-2 骨干网络),并在实验中扩展至 X-VLA 模型验证通用性
Card 06 评估与结果

评估与结果

  • 评估环境包括 LIBERO 的四个任务套件和 BridgeData V2 的 pick-and-place 任务。
  • 主要评估指标包括任务成功率 (SR)、平均高度/速度、阈值以上面积 (AAT) 和阈值以上速度 (SAT)。
  • 实验结果显示,静态引导(如系数 C=20)虽然能显著提升特定属性(如高度),但会导致任务成功率从 58% 降至 10% 甚至更低。
  • CTRL-STEER (PID) 在保持任务成功率接近未引导基线(如 54% vs 58%)的同时,实现了稳定的运动属性调节。
  • CTRL-STEER (RL) 实现了最佳的性能平衡,在高度引导任务中将成功率提升至 82%(基线为 77.5%),并在速度引导中维持了较高成功率。