返回列表
VLA / Vision-Language-Action 每日论文卡
FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models
论文针对视觉-语言-行动(VLA)模型因依赖大规模、冗余且价值不均的数据集而导致的效率瓶颈问题,提出了一种以数据为中心的生成式数据蒸馏框架FT-NCFM。该框架通过一个自包含的影响评估引擎(Fact-Tracing, FT)来评估样本的内在价值,并利用该评估结果引导一个对抗性的神经特征函数匹配(NCFM)过程,从而合成一个信息密度高、可复用的数据核心集。实验证明,仅使用5%的合成数据训练模型,即可达到使用完整数据集训练85-90%的任务成功率,同时将训练时间减少80%以上,展示了数据蒸馏在构建高效VLA模型中的巨大潜力。

论文详情

FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models

2025-11-20 · 原文 · 翻译 · 2511.16233

论文针对视觉-语言-行动(VLA)模型因依赖大规模、冗余且价值不均的数据集而导致的效率瓶颈问题,提出了一种以数据为中心的生成式数据蒸馏框架FT-NCFM。该框架通过一个自包含的影响评估引擎(Fact-Tracing, FT)来评估样本的内在价值,并利用该评估结果引导一个对抗性的神经特征函数匹配(NCFM)过程,从而合成一个信息密度高、可复用的数据核心集。实验证明,仅使用5%的合成数据训练模型,即可达到使用完整数据集训练85-90%的任务成功率,同时将训练时间减少80%以上,展示了数据蒸馏在构建高效VLA模型中的巨大潜力。

7 分钟读完 6 张阅读卡 根据论文的致谢部分,研究单位与中国国家自然科学基金和重庆市自然科学基金有关,推测主要研究机构位于中国重…
一眼看懂 封面预览

论文针对视觉-语言-行动(VLA)模型因依赖大规模、冗余且价值不均的数据集而导致的效率瓶颈问题,提出了一种以数据为中心的生成式数据蒸馏框架FT-NCFM。该框架通过一个自包含的影响评估引擎(Fact-Tracing, FT)来评估样本的内在价值,并利用该评估结果引导一个对抗性的神经特征函数匹配(NCFM)过程,从而合成一个信息密度高、可复用的数据核心集。实验证明,仅使用5%的合成数据训练模型,即可达到使用完整数据集训练85-90%的任务成功率,同时将训练时间减少80%以上,展示了数据蒸馏在构建高效VLA模型中的巨大潜力。

  • 论文针对视觉-语言-行动(VLA)模型因依赖大规模、冗余且价值不均的数据集而导致的效率瓶颈问题,提出了一种以数据为中心的生成式数据蒸馏框架FT-NCFM。该框架通过一个自包含的影响评估引擎(Fact-Tracing, FT)来评估样本的内在价值,并利用该评估结果引导一个对抗性的神经特征函数匹配(NCFM)过程,从而合成一个信息密度高、可复用的数据核心集。实验证明,仅使用5%的合成数据训练模型,即可达到使用完整数据集训练85-90%的任务成功率,同时将训练时间减少80%以上,展示了数据蒸馏在构建高效VLA模型中的巨大潜力。
  • 提出了一种新的生成式数据蒸馏范式,区别于现有的模型压缩和策略蒸馏等以模型为中心的优化路径,从数据层面提升VLA模型效率。
  • 设计了一个自包含的内在价值评估引擎FT。该引擎通过两阶段评估样本价值:首先使用因果归因进行预筛选,然后通过一个新颖的程序化对比验证模块,为精英样本生成“最小反例”来精炼其影响权重,从而稳健地量化样本的因果贡献和泛化潜力。
Card 01 研究单位

研究单位

根据论文的致谢部分,研究单位与中国国家自然科学基金和重庆市自然科学基金有关,推测主要研究机构位于中国重庆。

Card 02 论文概述

论文概述

论文针对视觉-语言-行动(VLA)模型因依赖大规模、冗余且价值不均的数据集而导致的效率瓶颈问题,提出了一种以数据为中心的生成式数据蒸馏框架FT-NCFM。该框架通过一个自包含的影响评估引擎(Fact-Tracing, FT)来评估样本的内在价值,并利用该评估结果引导一个对抗性的神经特征函数匹配(NCFM)过程,从而合成一个信息密度高、可复用的数据核心集。实验证明,仅使用5%的合成数据训练模型,即可达到使用完整数据集训练85-90%的任务成功率,同时将训练时间减少80%以上,展示了数据蒸馏在构建高效VLA模型中的巨大潜力。

Card 03 核心贡献

核心贡献

  1. 提出了一种新的生成式数据蒸馏范式,区别于现有的模型压缩和策略蒸馏等以模型为中心的优化路径,从数据层面提升VLA模型效率。
  2. 设计了一个自包含的内在价值评估引擎FT。该引擎通过两阶段评估样本价值:首先使用因果归因进行预筛选,然后通过一个新颖的程序化对比验证模块,为精英样本生成“最小反例”来精炼其影响权重,从而稳健地量化样本的因果贡献和泛化潜力。
  3. 在多个主流VLA基准测试上进行了系统性评估。结果表明,使用FT-NCFM框架和仅5%的合成数据,模型就能达到使用全量数据训练85-90%的性能,同时显著降低了训练时间和计算资源消耗(训练时间减少80%以上),优于多种SOTA方法。
Card 04 方法描述

方法描述

FT-NCFM框架包含一个三阶段的流水线:

  1. VLA多模态表示学习: 将原始的视觉、语言和行动数据通过各自的编码器和Transformer骨干网络,融合成一个统一的特征向量 h,作为后续分析的基础。
  2. FT影响评估引擎: 一个两阶段的样本价值评估过程。

* 阶段一:基于影响函数的因果归因预筛选: 使用影响函数近似移除单个训练样本对模型损失的影响,计算出基础影响分数。此阶段使用一个“引导模型”,该模型在原始数据上进行轻量级、不完全的训练。

* 阶段二:对比验证精化: 对前K%的精英样本,在模拟器中通过“跨模态不匹配”策略程序化地生成一个语义或物理矛盾的“最小反例”。然后,通过比较原始样本和其反例对测试用例的影响差异,使用一个包含tanh函数的权重调制公式来精炼最终的影响权重。

  1. 引导式NCFM: 将FT引擎计算出的一组影响权重用于指导NCFM的优化过程。通过将原始NCFM的期望计算改为基于权重的加权期望,迫使判别器关注高价值样本,从而引导生成器合成一个富含关键因果知识且信息密度极高的核心集。该核心集与原始数据格式相同,可直接用于训练任何下游VLA模型。
Card 05 数据集与资源

数据集与资源

  • 使用数据集:

* CALVIN: 一个用于长期语言条件策略学习的大规模机器人操作基准。

* Meta-World: 包含50种不同桌面操作任务的基准,用于评估多任务学习环境中的技能获取。

* LIBERO: 用于促进终身学习的基准套件,包含Spatial、Object、Goal和Long等多个子集。

  • 训练资源:

* 硬件: 实验主要在单块NVIDIA A100 80GB GPU上进行。

* 软件环境: Ubuntu 22.04.3 LTS, CUDA 12.4, Python 3.12.7, PyTorch 2.5.0。

* 时间成本: FT-NCFM框架的预处理阶段(FT引擎评估与NCFM合成)是一次性投资,在LIBERO数据集上约为24 GPU小时。在此之后,使用5%的合成数据训练下游策略模型仅需约7 GPU小时。

Card 06 评估与结果

评估与结果

  • 评估环境:

* 硬件: 1 × NVIDIA A100-SXM4-80GB GPU, AMD EPYC 7742 CPU, 47GiB内存。

* 软件: Ubuntu 22.04.3 LTS, CUDA 12.4, PyTorch 2.5.0, Python 3.12.7。

  • 评估指标:

* 性能指标:

* 成功率 或 平均任务完成长度: 用于在CALVIN、Meta-World和LIBERO上衡量任务完成的性能。CALVIN评估遵循D->A,B,C,D的长期任务泛化协议。

* 效率指标:

* 总训练时间: 以GPU小时为单位,衡量从随机初始化到模型收敛所需的总时间,用于评估训练效率。