返回列表
VLA / Vision-Language-Action 每日论文卡
FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization
提出 FlowPRO,一个用于流匹配视觉-语言-动作(VLA)模型的无奖励离线强化微调框架

论文详情

FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

2026-06-03 · 原文 · 翻译 · 2606.05468

提出 FlowPRO,一个用于流匹配视觉-语言-动作(VLA)模型的无奖励离线强化微调框架 解决真实机器人后训练中 SFT/DAgger 无法直接利用失败信号、基于奖励的 RL 需要设计奖励和训练 critic 的难题 通过偏好优化直接利用正负轨迹对,无需设计奖励函数

4 分钟读完 6 张阅读卡 Tencent Robotics X
一眼看懂 封面预览

提出 FlowPRO,一个用于流匹配视觉-语言-动作(VLA)模型的无奖励离线强化微调框架

  • 提出 FlowPRO,一个用于流匹配视觉-语言-动作(VLA)模型的无奖励离线强化微调框架
  • 解决真实机器人后训练中 SFT/DAgger 无法直接利用失败信号、基于奖励的 RL 需要设计奖励和训练 critic 的难题
  • 通过偏好优化直接利用正负轨迹对,无需设计奖励函数
Card 01 研究单位

研究单位

  • Tencent Robotics X
  • Futian Laboratory
  • Tsinghua University
Card 02 论文概述

论文概述

  • 提出 FlowPRO,一个用于流匹配视觉-语言-动作(VLA)模型的无奖励离线强化微调框架
  • 解决真实机器人后训练中 SFT/DAgger 无法直接利用失败信号、基于奖励的 RL 需要设计奖励和训练 critic 的难题
  • 通过偏好优化直接利用正负轨迹对,无需设计奖励函数
Card 03 核心贡献

核心贡献

  • 提出 RPRO 算法:一种针对流匹配 VLA 的偏好优化目标,引入显式近端正则化器,消除 Flow-DPO 的奖励黑客问题
  • 设计 干预-回滚 数据收集范式:单次操作员干预即可产生自然配对的偏好轨迹,并支持可变回滚步长
  • 提出 平滑插值 数据处理流程:将稀疏的轨迹级修正转化为密集的逐状态偏好监督,并设计固定比例的批次混合策略以保持基策略能力
Card 04 方法描述

方法描述

  • 基于流匹配 VLA 的动作头,使用流动损失作为负对数似然的代理,构建隐式奖励代理
  • 将 PRO 的损失分解推广到流匹配连续动作空间,联合对比优化器和显式近端正则化器,消除似然不确定性
  • 数据收集:操作员在策略执行出现错误时触发回滚,记录错误片段为负轨迹,随后演示正确行为记录为正轨迹
  • 平滑插值:对负轨迹上的状态,通过贝塞尔曲线合成指向正轨迹的正确动作,形成逐状态偏好对;对正轨迹和 SFT 数据,设置正负动作相同,利用对比梯度消失特性仅保留正则化与 SFT 损失
  • 训练时混合当前轮次偏好数据、历史偏好数据和 SFT 数据,按固定比例采样
Card 05 数据集与资源

数据集与资源

  • 任务数据:在真实机器人平台上收集的四个双机械臂操作任务数据,包括 Pack(化妆品包装)、Cap(笔帽组装)、USB(USB 插入)、Case(笔袋打包)
  • 模型:基于 PI0PI0.5 流匹配 VLA 骨干,参数规模未公开
  • 训练资源:使用 NVIDIA GPU 训练(具体型号见附录 G),真实机器人平台为 Dobot XTrainer
Card 06 评估与结果

评估与结果

  • 评估环境:四个真实机器人长时序双机械臂任务,每个任务执行 100 次随机初始化的测试
  • 基准方法:DAggerDAgger-BufferedPI0.6*、TPO
  • 主要指标:成功率(SR,%)和完成时间(CT,秒)
  • 关键结果:FlowPRO 在全部任务上取得最高成功率,例如 Pack 任务 99%,Cap 任务 98%,USB 任务 92%,Case 任务 93%;完成时间也显著缩短
  • 消融实验:在 Pack 任务上验证了 RPRO 中近端正则化器消除奖励黑客、SFT 项保持基策略能力的作用,平滑插值优于轨迹级对比