返回列表
VLA / Vision-Language-Action 每日论文卡
Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement
提出了一种名为 ForesightFlow 的自我引导式流匹配策略,用于提升视觉-语言-动作(VLA)模型在混合质量数据上的表现。

论文详情

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement

2026-06-03 · 原文 · 翻译 · 2606.04968

提出了一种名为 ForesightFlow 的自我引导式流匹配策略,用于提升视觉-语言-动作(VLA)模型在混合质量数据上的表现。 核心问题是:如何在不需要外部独立价值网络(Critic)的情况下,有效利用包含成功、失败和部分完成的混合质量经验来改进 VLA 策略。 ForesightFlow 通过让生成模型自身同时产出动作和预测成功潜力,实现了自我评估和候选动作筛选,从而简化了策略改进流程。

7 分钟读完 6 张阅读卡 作者来自多个机构,包括 Alibaba Group、Tsinghua University 和 BNU…
一眼看懂 封面预览

提出了一种名为 ForesightFlow 的自我引导式流匹配策略,用于提升视觉-语言-动作(VLA)模型在混合质量数据上的表现。

  • 提出了一种名为 ForesightFlow 的自我引导式流匹配策略,用于提升视觉-语言-动作(VLA)模型在混合质量数据上的表现。
  • 核心问题是:如何在不需要外部独立价值网络(Critic)的情况下,有效利用包含成功、失败和部分完成的混合质量经验来改进 VLA 策略。
  • ForesightFlow 通过让生成模型自身同时产出动作和预测成功潜力,实现了自我评估和候选动作筛选,从而简化了策略改进流程。
Card 01 研究单位

研究单位

  • 作者来自多个机构,包括 Alibaba GroupTsinghua UniversityBNU-HKBU United International College 等(标注为 1, 2, 3 脚注)。
  • 论文的具体作者列表为:Yunpeng Mei, Jiakai He, Hongjie Cao, Chenyu Wang, Xiaowen Zhu, Yihan Zhou, Jiamin Wang, Chenbo Xin, Peng Cheng, Yuxuan Yang, Yijie Wang, Xinhu Zheng, Gao Huang, Jie Chen, Gang Wang。
Card 02 论文概述

论文概述

  • 提出了一种名为 ForesightFlow 的自我引导式流匹配策略,用于提升视觉-语言-动作(VLA)模型在混合质量数据上的表现。
  • 核心问题是:如何在不需要外部独立价值网络(Critic)的情况下,有效利用包含成功、失败和部分完成的混合质量经验来改进 VLA 策略。
  • ForesightFlow 通过让生成模型自身同时产出动作和预测成功潜力,实现了自我评估和候选动作筛选,从而简化了策略改进流程。
Card 03 核心贡献

核心贡献

  • 自我引导的 VLA 流策略:提出了 ForesightFlow,通过将动作块与学习到的成功潜力向量结合,使同一个生成模型能够同时生成并评估候选动作。
  • 解耦优势加权流匹配:识别出在以统一方式加权所有坐标时,会出现价值幻觉(value hallucination)这一失败模式。提出了一种解耦目标,即只对动作速度应用优势权重,而对潜力速度进行均匀训练以保持校准。
  • 高效的一步预测与最佳选择推理:针对条件流匹配推导出一种边界估计器,仅需一次停止梯度前向传播即可计算优势加权回归(AWR)基线,并利用生成的潜力进行最佳选择(best-of-K)推理。
Card 04 方法描述

方法描述

  • 动作-潜力流状态:ForesightFlow 扩展了流匹配的端点,使其同时包含动作块和与时间对齐的成功潜力向量,从而让生成模型的输出自带评分。
  • 阶段级潜力目标:为解决稀疏奖励问题,为每个训练块分配阶段级语义标签(如“抓起纸卷”),即使整个任务失败,成功的子轨迹也能获得正向监督。
  • 解耦优势加权训练:在训练时,对动作速度的损失使用基于优势的指数加权,以强调高质量动作;而对潜力速度的损失在所有数据上均匀计算,使模型能学习到失败的样本,避免产生过度自信的评分。
  • 一步边界估计:利用流匹配在噪声点(σ=0)的属性,通过一次停止梯度前向传播估计出条件数据均值,作为计算优势的基线,从而避免了对每个训练样本进行昂贵的流积分。
  • 自我引导推理:在测试时,模型生成多个候选动作-潜力对,并直接执行其中潜力评分最高的动作块,无需外部 Critic 参与。
Card 05 数据集与资源

数据集与资源

  • 仿真数据集:基于 BEHAVIOR-1K 基准的5个任务,每个任务包含200条专家演示和100条由预训练模型 π0.5 生成的自主 rollout,均为混合质量数据。
  • 真实世界数据集:在 DexTeleop TeleAvatar Lite 双臂平台上收集了5个桌面操作任务的数据,包括VR遥操作的专家轨迹和 π0.5 模型生成的自主 rollout。
  • 模型架构:仿真实验基于 π0.5 架构微调;真实世界实验基于 π0 架构。模型规模与参数量在原文中未明确给出,但提及与基线模型使用匹配的骨干网络。
  • 训练资源:论文指出 ForesightFlow 相较于基线方法减少了 38% 的训练计算量,但未具体说明使用的 GPU/TPU 型号和数量。
Card 06 评估与结果

评估与结果

  • 评估环境:在 BEHAVIOR-1K 的5个长程仿真任务和5个真实世界双臂操作任务上进行评估。
  • 主要评估指标:仿真和真实世界任务均使用归一化任务得分(Q-Score)和完整任务成功率(Success Rate, SR)作为主要指标。
  • 关键实验结果

- 仿真性能:ForesightFlow 在平均任务得分(0.46)上达到最佳,在平均成功率(39.6%)上与最强的独立 Critic 基线 IDQL(39.0%)相匹配,并优于行为克隆(BC)和过滤式行为克隆(Filtered BC)等模仿学习方法。

- 真实世界性能:ForesightFlow 在平均任务得分和成功率上均优于所有基线方法,实现了最佳表现。

- 计算效率:ForesightFlow 在达到与 IDQL 竞争性性能的同时,减少了 38% 的训练计算量。

- 消融实验:验证了解耦加权能防止价值幻觉,一步预测估计器能保持候选动作的排序保真度,以及自我引导采样能提升长程任务执行表现。