一眼看懂
封面预览
针对具身视觉-语言决策任务中视觉语言模型(VLM)和视觉语言动作模型(VLA)共同面临的感知瓶颈问题,即视觉幻觉、注意力漂移和对象遗漏
- 针对具身视觉-语言决策任务中视觉语言模型(VLM)和视觉语言动作模型(VLA)共同面临的感知瓶颈问题,即视觉幻觉、注意力漂移和对象遗漏
- 提出一种粗到细的焦点计划生成方法,通过自主生成焦点计划帮助模型聚焦任务相关对象,抑制背景干扰
- 旨在提升 VLM 的长期规划能力和 VLA 的实时反应控制能力,同时减少计算开销
Card 01
研究单位
研究单位
- 论文作者所属研究机构未在论文 HTML 中直接列出
Card 02
论文概述
论文概述
- 针对具身视觉-语言决策任务中视觉语言模型(VLM)和视觉语言动作模型(VLA)共同面临的感知瓶颈问题,即视觉幻觉、注意力漂移和对象遗漏
- 提出一种粗到细的焦点计划生成方法,通过自主生成焦点计划帮助模型聚焦任务相关对象,抑制背景干扰
- 旨在提升 VLM 的长期规划能力和 VLA 的实时反应控制能力,同时减少计算开销
Card 03
核心贡献
核心贡献
- 提出 SceneDiver 方法,通过粗到细的两阶段焦点计划生成,打破 VLM 在视觉决策中的感知瓶颈
- 设计粗粒度场景图推理与细粒度自主验证与探索的迭代流程,渐进式分解复杂场景并识别任务相关对象
- 构建轻量级 SceneDiver Adapter,将显式焦点规划能力蒸馏到 VLA 中,实现实时反应控制下的鲁棒感知
- 在机器人操作、室内导航和 LIBERO-plus 基准上验证方法有效性,显著降低视觉幻觉,提升决策成功率和鲁棒性
Card 04
方法描述
方法描述
- 粗粒度阶段:利用 OvSGTR 后端将原始图像转换为场景图表示,VLM 进行图推理,将复杂全局场景分解为一系列简单局部子场景
- 细粒度阶段:VLM 以自主式代理方式依次探索每个子场景,进行语义缩放和局部空间搜索,验证并识别任务相关对象
- 焦点调制:将识别出的对象边界框渲染为像素级焦点得分图,通过软性调制(降低亮度、模糊高频细节)生成调制图像,引导 VLM 进行最终决策
- SceneDiver Adapter:采用任务引导的 Slot Attention 提取结构化对象表示,通过场景感知掩码预测模块模拟粗到细推理过程,并使用匈牙利匹配进行知识蒸馏,引入基于熵的动态门控机制保证安全性
Card 05
数据集与资源
数据集与资源
- 机器人操作任务:基于 MuJoCo 仿真环境,构建含干扰物的 30 个复杂场景
- 室内导航任务:基于 EmbodiedBench 的增强版,包含更高环境复杂度和更小、更易遮挡的目标对象
- 端到端控制鲁棒性:使用 LIBERO-plus 基准,包含空间布局、相机视角、机器人初始状态、背景纹理和光照条件等干扰
- 模型规模:测试了 Qwen2.5-VL-7B/32B-Instruct-AWQ、InternVL2.5-8B、gpt-4o-mini、gemini-2.5-flash 等开源和闭源 VLM,以及 OpenVLA-OFT 作为 VLA 基础模型
- 训练资源未在论文中明确说明
Card 06
评估与结果
评估与结果
- 机器人操作:在 30 步装配任务中,SceneDiver 使各 VLM 后端成功率提升 10%–15%(如 Qwen2.5-VL-7B 从 14.7% 升至 28.7%)
- 室内导航:在基础、常识、复杂指令和视觉外观四个子任务中,方法显著优于 SoM、Multi-Res、VCD 等现有聚焦策略,在多个模型上实现最高 16% 的提升(如 Qwen2.5-VL-32B 的基础任务从 49.3% 升至 56.7%)
- 端到端控制(LIBERO-plus):SceneDiver Adapter 在保持计算开销仅增加 2.64% 的情况下,平均成功率提升 9.6%(如相机视角任务从 19.91% 升至 29.49%)
- 消融与压力测试:验证了SceneDiver各组件(粗阶段、细阶段、调制)的必要性,并证明方法对含噪声/错误的场景图具有鲁棒性