系统性地重新审视了具身思维链(Embodied Chain-of-Thought, ECoT)在可泛化机器人操作中的作用,重点探索其有效形式、与策略的交互方式以及可扩展性。
- 系统性地重新审视了具身思维链(Embodied Chain-of-Thought, ECoT)在可泛化机器人操作中的作用,重点探索其有效形式、与策略的交互方式以及可扩展性。
- 构建了目前最大规模的具身思维链数据集(978,743 条轨迹,226.3M 样本,2,592.5 小时),并基于此数据集揭示纯高层语义推理对动作生成的增益有限,必须将语义理解与具体动作指引(如末端执行器轨迹、图像空间点轨迹)相结合才能有效提升控制性能。
- 指出了显式 CoT 作为自回归动作前缀的不可靠扩展问题(复合错误),提出了 ERVLA 模型,将 CoT 作为训练信号而非推理时必要的前缀,通过推理丢弃(reasoning dropout)策略实现从感知到动作的表示重塑,并解决了 CoT 标注噪声带来的CoT 污染问题。
研究单位
- Tsinghua University(清华大学)
- Xiaomi Robotics(小米机器人)
- Peking University(北京大学)
- CASIA(中国科学院自动化研究所)
- HKUST(GZ)(香港科技大学(广州))
- Zhejiang University(浙江大学)
- Fudan University(复旦大学)
- Wuhan University(武汉大学)
- Shanghai Innovation Institute(上海创新研究院)
论文概述
- 系统性地重新审视了具身思维链(Embodied Chain-of-Thought, ECoT)在可泛化机器人操作中的作用,重点探索其有效形式、与策略的交互方式以及可扩展性。
- 构建了目前最大规模的具身思维链数据集(978,743 条轨迹,226.3M 样本,2,592.5 小时),并基于此数据集揭示纯高层语义推理对动作生成的增益有限,必须将语义理解与具体动作指引(如末端执行器轨迹、图像空间点轨迹)相结合才能有效提升控制性能。
- 指出了显式 CoT 作为自回归动作前缀的不可靠扩展问题(复合错误),提出了 ERVLA 模型,将 CoT 作为训练信号而非推理时必要的前缀,通过推理丢弃(reasoning dropout)策略实现从感知到动作的表示重塑,并解决了 CoT 标注噪声带来的CoT 污染问题。
核心贡献
- 构建了最大的具身思维链语料库,覆盖多种机器人操作数据集,提供结构化、多层次的推理标注(目标、规划、子任务、运动、空间坐标、点轨迹、物体框等),为大规模具身推理研究奠定基础。
- 识别并定义了CoT 污染问题,指出大规模自动标注中噪声信号(如抖动边界框、漂移末端坐标)会损害策略学习,并提出利用推理丢弃作为训练正则化手段,有效缓解这一问题。
- 提出 ERVLA(Embodied Reasoning Vision-Language-Action)模型,采用混合 Transformer 架构(VLM + DiT 扩散头),通过知识截断、辅助动作查询回归和选择策略将推理监督内化到 VLM 表示中,实现推理时无需 CoT 即可生成连续动作。
- 在 LIBERO-Plus(86.9% 成功率)和 VLABench(53.2% 成功率)上取得领先性能,并在真实机器人实验中展示出对语义歧义和长时域任务的鲁棒性。
- 通过大量对照实验,系统性地阐明了有效具身思维链的信号特性(动作相关推理优于纯高层语义)、推理与策略交互的合理方式(CoT 作为训练信号优于作为推理前缀)以及CoT 预训练的可扩展性(在 ERVLA 架构下,更多 CoT 数据带来性能提升)。
方法描述
- 结构化 CoT 数据构建:将具身推理分解为高层文本描述(目标、规划、子任务、运动、推理)和数值坐标(夹爪坐标、点轨迹、边界框),通过自动标注流水线为大规模机器人数据集生成多视图、多粒度的推理标注。
- ERVLA 架构:由 Qwen3-VL-4B 视觉语言模型作为推理主干,处理图像、指令和显式 CoT(可选),输出隐藏状态和逐层 KV 缓存;扩散 Transformer(DiT) 根据 VLM 的 KV 缓存和机器人状态,通过流匹配生成连续动作块。
- 知识截断(Knowledge Truncation):DiT 仅允许访问 VLM 的语义前缀 KV 缓存(排除控制查询令牌),以防止动作生成器利用合成捷径,保证条件信息来自真正的语义理解。
- 辅助动作查询回归:在 VLM 中插入可学习的动作查询令牌,直接监督其预测候选动作块和评分,使 VLM 的表示能够对齐高层推理与低层动作,并允许梯度从动作损失回传至 VLM。
- 推理丢弃(Reasoning Dropout):训练时按概率为每个样本随机切换启用(/cot)或禁用(/no_cot)显式 CoT,使模型学会在无 CoT 条件下直接生成动作,同时减少对噪声 CoT 标注的依赖,将推理内化为表示层面的能力。
- 训练目标:联合优化 VLM 的 CoT 交叉熵损失、流匹配损失、选择策略损失(最小化最佳候选动作的 MAE)和评分损失(预测候选动作误差),实现端到端的推理-动作一体化学习。
数据集与资源
- 具身 CoT 预训练集:基于 Bridge、Fractal、Droid、MolmoAct、AgiBot 等公开数据集进行标注,包含 978,743 条轨迹,226.3M 样本,2,592.5 小时数据,覆盖单臂/双臂、单视图/多视图场景。
- 下游基准:LIBERO(含 LIBERO-Plus 鲁棒性扩展)、VLABench(分布外泛化、常识推理、指令跟随)以及真实机器人任务。
- 模型规模:VLM 主干为 Qwen3-VL-4B(约 4B 参数),DiT 动作头参数未明确披露,整体模型规模适中。
- 训练资源:论文未明确说明具体 GPU 或 TPU 配置,但涉及大规模预训练,推测使用多 GPU 集群。
评估与结果
- 评估环境:仿真基准 LIBERO-Plus(零样本迁移,含相机、状态、语言、光照、背景等扰动)和 VLABench(分布内、跨品类、常识推理、指令跟随、纹理变化等五轨),以及真实机器人平台上的语义歧义和长时域任务。
- 主要指标:任务成功率(Success Rate)。
- 关键结果:
- 在 LIBERO-Plus 上取得 86.9% 总成功率,其中 Spatial 轨迹在背景和光照变化下达到 100% 成功率,显著优于 ECoT、Emma-X、OpenVLA-OFT、π0、π0.5 等基线。
- 在 VLABench 上取得 53.2% 平均成功率,尤其在分布外设置(跨品类迁移、常识推理、指令跟随)上表现突出。
- 真实机器人实验中,相比 SOTA 基线,ERVLA 在处理语义歧义和长时域任务时表现出更强的鲁棒性。
- 消融研究证实:动作相关的 CoT 信号(如运动描述、点轨迹)比纯高层语义更有效;推理丢弃可缓解 CoT 污染,使不稳定坐标标注的负面影响从 -6.1 降至 -1.0;在 ERVLA 架构下,增加 CoT 预训练数据能可靠提升性能,而传统自回归 CoT+动作模型在数据量增加时反而退化。