返回列表
VLA / Vision-Language-Action 每日论文卡
Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies
论文提出 Lagrangian Perturbation Diffusion Steering (LP-DS) 方法,一种轻量级的在线适应性方法,用于改进冻结的生成策略。

论文详情

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

2026-05-31 · 原文 · 翻译 · 2606.01151

论文提出 Lagrangian Perturbation Diffusion Steering (LP-DS) 方法,一种轻量级的在线适应性方法,用于改进冻结的生成策略。 核心目标是解决直接微调大型生成解码器不稳定、样本效率低,以及现有噪声空间引导方法可能导致偏离先验分布和模式崩溃的问题。 方法通过学习一个紧凑的噪声空间残差扰动来引导策略,在不修改解码器的情况下实现高效、稳定的性能改进。

5 分钟读完 6 张阅读卡 作者所属机构信息未在HTML原文中明确列出。
一眼看懂 封面预览

论文提出 Lagrangian Perturbation Diffusion Steering (LP-DS) 方法,一种轻量级的在线适应性方法,用于改进冻结的生成策略。

  • 论文提出 Lagrangian Perturbation Diffusion Steering (LP-DS) 方法,一种轻量级的在线适应性方法,用于改进冻结的生成策略。
  • 核心目标是解决直接微调大型生成解码器不稳定、样本效率低,以及现有噪声空间引导方法可能导致偏离先验分布和模式崩溃的问题。
  • 方法通过学习一个紧凑的噪声空间残差扰动来引导策略,在不修改解码器的情况下实现高效、稳定的性能改进。
Card 01 研究单位

研究单位

  • 作者所属机构信息未在HTML原文中明确列出。
Card 02 论文概述

论文概述

  • 论文提出 Lagrangian Perturbation Diffusion Steering (LP-DS) 方法,一种轻量级的在线适应性方法,用于改进冻结的生成策略。
  • 核心目标是解决直接微调大型生成解码器不稳定、样本效率低,以及现有噪声空间引导方法可能导致偏离先验分布和模式崩溃的问题。
  • 方法通过学习一个紧凑的噪声空间残差扰动来引导策略,在不修改解码器的情况下实现高效、稳定的性能改进。
Card 03 核心贡献

核心贡献

  • 引入 Lagrangian Perturbation Diffusion Steering (LP-DS) 框架,一种轻量级适应性方法,通过学习状态条件化的噪声空间残差扰动来改进冻结的生成策略。
  • 提出 Lagrangian trust-region objective,动态约束扰动幅度,通过信任区域目标 δ 提供可控机制平衡奖励最大化与预训练潜在先验的保留。
  • 证明 LP-DS 相比于先验替换的噪声空间引导方法能缓解模式崩溃,在保持更高动作空间多样性的同时实现强性能。
  • 验证 LP-DS 超越紧凑扩散策略的适用性,包括匹配的扩散/流匹配骨干对比、大型视觉-语言-动作 π₀ 模型,以及物理 Franka 机器人部署。
Card 04 方法描述

方法描述

  • 核心思想是将冻结的生成解码器视为从噪声到动作的黑盒映射,通过在潜在噪声空间中学习一个状态条件的残差扰动 Δθ(s) 来引导策略,公式为 w = ε + Δθ(s)。
  • 创新点在于使用 拉格朗日信任区域目标 进行约束优化:最大化下游价值的同时,限制扰动偏离潜在先验的程度,防止“非分布”的噪声查询导致解码不稳定。
  • 关键技术包括:基于扰动幅度的KL散度近似、拉格朗日松弛方法求解约束问题、对潜在价值函数 Q^W 的蒸馏学习,以及原始变量θ与对偶变量α的交替更新算法。
Card 05 数据集与资源

数据集与资源

  • 使用 RoboMimic 机器人操作基准、OpenAI Gym 运动环境基准、Adroit 灵巧操作基准进行评估。
  • 在额外实验中使用 LIBERO 基准和大型视觉-语言-动作模型 π₀ 作为骨干网络。
  • 进行了真实世界的 Franka Panda 机器人部署实验。
  • 论文中未提及具体的模型参数量或训练计算资源(如GPU/TPU)细节。
Card 06 评估与结果

评估与结果

  • 评估环境涵盖机器人操作、运动控制和灵巧操作三大类基准测试。
  • 主要评估指标包括任务成功率、回合回报值和基于Kozachenko-Leonenko估计器的动作空间熵。
  • 关键结果显示,LP-DS 在大多数环境中优于基线方法;例如在 Walker2D 上,相比最强基线提升约 25% 的回合回报值。
  • 实验证明 LP-DS 在性能改进的同时能保持比无约束噪声空间引导方法更高的动作空间熵,有效缓解模式崩溃。
  • 真实机器人实验显示,在抓取放置任务中成功率从冻结骨干的18/40提升到 33/40,在挂杯任务中从11/20提升到 17/20