一眼看懂
封面预览
论文旨在解决接触丰富操作任务中,视觉-语言-动作(VLA)模型的语义推理与高频接触动力学之间的接口不匹配问题。
- 论文旨在解决接触丰富操作任务中,视觉-语言-动作(VLA)模型的语义推理与高频接触动力学之间的接口不匹配问题。
- VLA模型输出速率低,缺乏力敏感任务所需的直接控制可靠性,论文提出将VLA输出从直接电机命令转变为任务级柔顺性提案。
- 核心框架 PaCo-VLA 引入一个高频、独立于提案的无源屏蔽层,通过能量罐会计和边界检查,确保只有安全、验证过的提案被执行,从而填补语义到控制的差距。
Card 01
研究单位
研究单位
- 第一作者 Haofan Cao 同时隶属于 西南交通大学 和 利兹大学。
- 其他作者 Zhaoyang Li、Zhichao You、Liang Guo、Tianrui Li 均来自 西南交通大学。
Card 02
论文概述
论文概述
- 论文旨在解决接触丰富操作任务中,视觉-语言-动作(VLA)模型的语义推理与高频接触动力学之间的接口不匹配问题。
- VLA模型输出速率低,缺乏力敏感任务所需的直接控制可靠性,论文提出将VLA输出从直接电机命令转变为任务级柔顺性提案。
- 核心框架 PaCo-VLA 引入一个高频、独立于提案的无源屏蔽层,通过能量罐会计和边界检查,确保只有安全、验证过的提案被执行,从而填补语义到控制的差距。
Card 03
核心贡献
核心贡献
- 提出了 VLA-to-Compliance 接口,使学习模型仅提出语义绑定和柔顺性调度,而机器人执行屏蔽后的植物命令。
- 开发了独立于提案的采样-柔顺性运行时合同,结合盒/无源投影、能量罐会计、力监控、时间检查和防护恢复机制。
- 提供了结合运行时合同消融、配对语义反事实和直接动作接口测试的评估协议,用于分离因果语义价值、屏蔽/恢复效果和聚合成功。
Card 04
方法描述
方法描述
- PaCo-VLA 将语义权威与接触权威分离。VLA提供低率柔顺性先验,包含语义绑定、任务阶段、恢复提示和对角柔顺性调度。
- 高频的提案独立屏蔽层评估所有提案(学习、延迟、随机、经典、恢复),通过投影、无源裕度强制、能量罐限制和力/扭矩监控,生成唯一可执行调度。
- 关键技术包括:对角柔顺性控制的采样无源裕度强制、通过能量罐会计管理活跃能量注入、以及通过防护执行处理提案缺失、延迟上下文或不安全状态。
Card 05
数据集与资源
数据集与资源
- 使用真实硬件平台进行实验,包括 AUBO-i5 机械臂、DH Robotics AG-160-95 夹持器、Intel RealSense D435i/D415 相机和 KWR75B 六轴力/扭矩传感器。
- 论文以 OpenVLA 等预训练VLA模型作为语义提案源,未提及具体模型参数量或训练细节。
- 实验在仿真和真实机器人上进行,附录提及了计算资源,但具体GPU/TPU信息未在提供的文本中明确。
Card 06
评估与结果
评估与结果
- 评估环境包括仿真连接器插入和真实机器人实验(连接器插入、EV充电枪插拔)。
- 主要评估指标为任务成功率(需满足插入深度和横向公差)和安全性成功率(无终止阈值违规、无应用无源违规)。
- 关键结果:PaCo-VLA 在对抗性柔顺性调度下保持 0/1000 无源违规,而移除投影后违规率达50.5%。
- 在反事实语义评估中,实时语言-视觉条件成功率接近Oracle(141/144),所有语义控制条件(如遮蔽图像、打乱语言)均零成功,证明成功依赖语义输入而非几何捷径。
- 在真实机器人连接器插入实验中,PaCo-VLA 实现接触成功率 10/10 和插入成功率 9/10,且最终横向误差更低(0.181±0.108 mm),无安全违规。