一眼看懂
封面预览
针对当前基于扩散模型的视觉-语言-动作策略中存在的 Euclidean Fallacy(欧几里得谬误)问题,即错误地将 SE(3) 位姿表示为平坦向量导致流形漂移和几何失效
- 针对当前基于扩散模型的视觉-语言-动作策略中存在的 Euclidean Fallacy(欧几里得谬误)问题,即错误地将 SE(3) 位姿表示为平坦向量导致流形漂移和几何失效
- 提出 Lie Diffuser Actor (LDA),一种在 SE(3) 李群流形上内在运行的扩散框架,通过左不变 SDE 和切空间分数匹配修正几何错误
- 目标是保证生成的机器人轨迹满足旋转约束(SO(3))、具备坐标变换等变性且符合运动学最优路径
Card 01
研究单位
研究单位
- 论文原文片段中未明确列出作者所属的具体研究机构,作者名单为:Bing-Cheng Chuang, I-Hsuan Chu, Bor-Jiun Lin, YuanFu Yang, Min Sun, Chun-Yi Lee
Card 02
论文概述
论文概述
- 针对当前基于扩散模型的视觉-语言-动作策略中存在的 Euclidean Fallacy(欧几里得谬误)问题,即错误地将 SE(3) 位姿表示为平坦向量导致流形漂移和几何失效
- 提出 Lie Diffuser Actor (LDA),一种在 SE(3) 李群流形上内在运行的扩散框架,通过左不变 SDE 和切空间分数匹配修正几何错误
- 目标是保证生成的机器人轨迹满足旋转约束(SO(3))、具备坐标变换等变性且符合运动学最优路径
Card 03
核心贡献
核心贡献
- 识别并形式化了扩散 VLA 策略中的 Euclidean Fallacy,揭示了其导致的流形漂移、等变性破坏和非最优轨迹三大问题
- 提出了 LDA 方法,理论上证明了其具备消除流形漂移、保证左不变等变性以及生成测地线轨迹的特性
- 在 CALVIN 和 LIBERO 基准以及真实机器人实验中验证了方法的有效性,展示了几何一致性带来的性能提升
Card 04
方法描述
方法描述
- 扩散过程定义在 SE(3) 流形上:前向过程通过指数映射将切空间噪声映射到流形,反向过程在切空间 $\mathfrak{se}(3)$ 预测分数并进行指数映射更新
- 网络架构包含几何上下文编码器(基于点云的 Graph Attention Transformer 和 CLIP 语言编码)和迭代去噪 Transformer
- 关键创新在于 切空间预测头,网络输出 6 维 twist 向量而非 12 维位姿向量,通过指数映射确保几何约束自动满足
Card 05
数据集与资源
数据集与资源
- 仿真评估主要使用 CALVIN 基准(包含 ABC$\rightarrow$D 和 ABCD$\rightarrow$D 设置)和 LIBERO 基准
- 真实机器人评估包含四个任务:Move Doll Platform, Put Block in Box, Sort Blocks, Stack Cups
- 训练资源:LDA 模型训练 300K iterations,对比基线 3D Diffuser Actor 训练了 600K 至 800K iterations
Card 06
评估与结果
评估与结果
- 在 CALVIN ABC$\rightarrow$D 任务中,LDA 将平均任务长度从基线的 3.27 提升至 3.51(+7.3%)
- 在 CALVIN ABCD$\rightarrow$D 任务中,LDA 仅用 300K 训练步即达到 3.584 的平均长度,优于基线 800K 训练步的 3.288
- 真实机器人实验中,LDA 在多数任务上表现优于基线,特别是在 "Move Doll" 任务达到 100% 成功率,在 "Sort Blocks" 任务成功率从基线的 55% 提升至 75%
- 几何分析实验表明,LDA 的 SO(3) 正交性违规率更低且更稳定,证明了消除流形漂移的有效性