欢迎光临
我们一直在努力

JEPA-VLA:VLA模型需要视频预测嵌入

26年2月来自清华和华为诺亚实验室的论文“JEPA-VLA: Video Predictive Embedding is Needed for VLA Models”。

近年来,基于预训练视觉-语言模型(VLM)构建的视觉-语言-动作(VLA)模型在机器人操作方面取得了显著进步。然而,当前的VLA模型仍然存在样本效率低和泛化能力有限的问题。本文认为,这些局限性与一个被忽视的组成部分——预训练视觉表征——密切相关,因为预训练视觉表征在环境理解和策略先验方面提供的信息不足。VLA中常用的视觉表征,无论是通过语言-图像对比学习还是基于图像的自监督学习进行预训练,都无法充分捕捉关键的、与任务相关的环境信息,也无法有效地诱导策略先验,即无法预测环境在任务成功执行过程中如何演变。相比之下,在视频上预训练的预测嵌入(特别是 V-JEPA 2)能够灵活地舍弃不可预测的环境因素,并编码与任务相关的动态时间信息,从而有效地弥补现有视觉-语言-动作(VLA)模型中视觉表征的关键缺陷。基于这些观察,提出 JEPA-VLA,能够自适应地将预测嵌入集成到现有的 VLA 中。


对VLA中常用的视觉表征比较如图所示:(a)基于图像的自监督学习(例如DINO系列)能够生成精确的视觉表征,但对任务相关性相对不敏感,并且会保留与任务无关的细节。(b)语言-图像对比学习(例如CLIP和SigLIP系列)强调与指令一致的实体和语义,但可能无法捕捉到文本中明确描述之外的底层任务相关信息。(c)基于视频的预测学习(例如V-JEPA 2)为任务相关的对象提供以状态为中心的表征,同时还编码作为策略先验的时间规律,而这些时间规律很难通过仅基于图像的预训练获得。
请添加图片描述

初步实验如图所示:(a) 轨迹演示和状态定义;给定观测值 {o_t},将每个时间步的底层状态分解为任务相关部分和任务无关部分。(b) 实验设置;冻结不同的视觉编码器,并训练一个轻量级的 ViT 头部来回归或预测环境状态。© 实验结果;与 DINOv2 和 SigLIP 相比,V-JEPA 2 在任务相关的回归和预测上始终获得更低的相对损失,但在任务无关(光照/背景)回归上没有优势,这表明 V-JEPA 2 能更好地捕捉任务相关的环境状态和策略先验,同时去除干扰因素。
请添加图片描述

环境理解

有效的操作需要视觉表征来捕捉环境中与任务相关的方面,例如机械臂和可移动物体的状态,同时忽略不影响动作执行的干扰因素(例如背景纹理和光照)。为了评估不同的视觉表征是否具备这些特性,其设计两个探测实验,分别评估它们编码任务相关状态和忽略任务无关变化的能力。

任务相关状态估计

设置。在 LIBERO-10 基准测试(Liu,2023)上进行实验,通过视觉表征回归机械臂和任务相关物体的状态。视觉编码器被冻结,并使用从最近两帧提取的表征训练一个轻量级回归头。用均方误差 (MSE) 作为评估指标。

结果如上图 c(左)所示,与 DINOv2 和 SigLIP 相比,V-JEPA 2 在回归当前任务相关状态时实现更低的均方误差 (MSE)。基于图像的自监督表征(例如 DINOv2)倾向于保留整幅图像的详细视觉信息,这可能会引入与操作任务不符的归纳偏差,导致表征虽然通常精确,但并非以任务为中心。相比之下,语言-图像表征(例如 SigLIP)强调文本中提及的实体,但可能会忽略那些通常不明确提及的任务相关对象。V-JEPA 2 使用基于视频的预测目标进行预训练,能够捕捉以对象为中心和与运动相关的线索,从而提供与任务相关状态更一致的表征。

发现 1. V-JEPA 2 表征比 DINOv2 和 SigLIP 更精确地编码任务相关的环境状态。

任务无关状态估计

设置。用 LIBERO-plus 基准测试(Fei,2025)进一步评估视觉表征对任务无关因素的敏感性。该基准测试引入不会影响所需动作序列的扰动。重点关注光照和背景变化,并训练模型从视觉表征中回归这些扰动属性。由于此类扰动在每个轨迹中保持不变,因此仅使用第一帧作为输入。​​

结果 如上图 c(右)所示,与 DINOv2 和 SigLIP 相比,V-JEPA 2 在回归光照和背景扰动方面表现出更高的误差。该结果表明 V-JEPA 2 编码的关于任务无关干扰因素的信息较少,这表明其表征选择性地关注与操作更相关的动态和视觉线索。这种对无关变化的不敏感性是可取的,有助于提高模型的鲁棒性和泛化能力。

发现 2. 与 DINOv2 和 SigLIP 相比,V-JEPA 2 表示编码的关于任务无关视觉因素的信息较少。

策略先验

策略先验对应于对任务相关环境状态在成功执行动作后如何演变的预期知识。并非直接预测未来的观测结果,而是评估视觉表示是否编码关键的、与状态转换相关的信息,这些信息反映任务相关状态的变化,即使部分可观测。

设置。在 LIBERO-10 基准数据集上训练模型来预测未来的状态变化。具体来说,为了减轻部分观测对状态估计不准确的影响,训练一个轻量级的头部模型,使用冻结的视觉表示来预测 10 步后任务相关状态与当前状态之间的残差。

结果如上图c(中间)所示,与 DINOv2 和 SigLIP 相比,V-JEPA 2 在预测状态残差方面取得更低的均方误差 (MSE)。这表明 V-JEPA 2 编码感知状态转换的表征,能够捕捉与任务成功执行相一致的时间规律。相比之下,基于静态图像预训练的图像表征缺乏显式的时间监督,难以捕捉此类状态转换动态,从而限制它们诱导有效策略先验的能力。

发现 3。V-JEPA 2 表征有效地嵌入策略先验。


鉴于这些发现,提出 JEPA-VLA,将强大的 V-JEPA 2 表示融入到 VLA 中。

问题描述

考虑两个主要组成部分:动作模型 π_θ 和一个冻结的、预训练的 V-JEPA 2 编码器 E_φ。动作模型 π_θ 遵循标准的 VLA 公式:它以语言指令 l、来自 N 个摄像头(例如,头部、手腕和辅助视角)的多视角观测数据 o0:N_t 以及机器人的本体感觉状态 s_t 作为输入,并根据以下公式生成动作 a_t:

a_t ∼ π_θ (a_t | l, o0:N_t, s_t) (1)

同时,冻结的 V-JEPA 2 编码器基于 ViT (Dosovitskiy, 2020) 骨干网络构建,并将视频片段 o_t−h:t 映射到视觉表征 h_t,其中 N 与空间和时间分辨率 H、W 和 T 成比例。该过程形式化为:

h_t ∼ E_φ (h_t | o_t−h:t) (2)

目标是学习一个增强的动作模型,该模型能够有效地利用预测性视觉表征 h_t:

a_t ∼ π_θ (a_t | l, o0:N_1:t, s_t, h_t), (3)

从而提高环境理解能力并生成更可靠的动作。

表征融合

为了使动作模型能够基于额外的视觉表征,实现两种融合策略。

前融合。大多数视觉学习活动 (VLA) 都基于 Transformer 框架构建。一种自然的方法是将 V-JEPA 2 表征视为额外的输入嵌入,并将其与原始token序列连接起来。这种设计非常轻量级,因为它仅引入一个线性投影来在融合之前对齐表征维度。经验表明,这种简单的连接方法对于没有大规模机器人操作预训练的 VLA 效果良好,因为这些 VLA 的策略很大程度上是从零开始学习的(尽管它们共享共同的视觉学习活动先验)。

门控融合。然而,这种简单的融合方法对于在大规模机器人操作数据上预训练的 VLA 无效。直接注入额外的token可能会改变输入分布并干扰预训练的表征,从而导致迁移率下降。为了更好地将 V-JEPA 2 表示适应这种更常用且数据效率更高的环境,设计一种保留预训练先验知识的替代架构。受 Flamingo(Alayrac,2022)的启发,通过多个门控交叉注意层整合 V-JEPA 2 表示,其中原始 VLA token作为查询,而 V-JEPA 2 表示作为KV对。这种门控设计使得 VLA 能够在有利时选择性地关注预测嵌入,从而实现自适应整合,同时最大限度地减少对预训练知识的干扰。

实际上,为了平衡学习性能、内存使用和推理延迟,并没有在每个 Transformer 解码器层之后都插入一个门控交叉注意层。相反,根据实验结果,其采用一种稀疏融合方案,在解码器堆栈中以固定间隔插入门控交叉注意层,这种方案既高效又足够有效。为了在不破坏预训练的VLA表征的前提下,稳定地融合来自V-JEPA 2的互补信息,遵循Flamingo(Alayrac,2022)的设计原则,将新引入的融合层的学习率设置得远低于原始VLA参数的学习率。

如图所示 JEPA-VLA 融合的整体架构。考虑两种典型场景,具体取决于底层视觉-语言-动作 (VLA) 模型是否已在大规模机器人操作数据集上进行预训练。
请添加图片描述

1)从零开始训练

对于从零开始训练或未进行大量机器人特定预训练的 VLA,简单的融合策略就足够了。在这种情况下,V-JEPA 2 表示被视为额外的输入嵌入,并与原始token序列连接起来。这种直接的设计有效地将视频预测知识注入到 VLA 中,使策略能够利用 V-JEPA 2 提供的时序和状态信息。

2)预训练后

然而,对于已经在大规模机器人数据集上进行过预训练的 VLA,简单的连接可能会产生不利影响。直接引入额外的嵌入会改变输入分布,并可能干扰预训练的表示,从而破坏学习的先验信息,导致性能下降。当预训练的 VLA 模型已经内化了强大的任务特定或动作对齐表征时,这个问题尤为突出。

为了应对这一挑战,通过门控交叉注意层融合 V-JEPA 2 表征。在该设计中,原始 VLA token 嵌入作为查询,而 V-JEPA 2 表征则作为KV对。门控机制使得模型能够自适应地控制预测性视觉表征的贡献,在有益的情况下选择性地关注 V-JEPA 2 特征,同时保留原始的预训练先验信息。这种自适应融合能够有效地从 V-JEPA 2 迁移知识,而不会破坏预训练的 VLA 表征的稳定性。


实现细节

在标准的视觉语言分析(VLA)设置中实现 JEPA-VLA,其中策略基于第三人称视觉观察和语言指令。具体来说,从最近两帧中提取 V-JEPA 2 表示,并将其与当前观察结果一起用作预测动作时的附加条件信号。用两种基础 VLA 进行实验,如下所述。

基础 VLA 实验。为了评估 V-JEPA 2 表示对 VLA 的有效性,首先实现一个基础 VLA 模型架构,该架构由预训练的视觉-语言模型(VLM)骨干网络和线性动作预测头组成。受 WorldVLA 架构(Cen,2025b)的启发,用 Chameleon(Team,2024)作为 VLM 骨干网络,并将动作离散化为 256 个 token,这与之前的研究(Kim,2025b)一致。在 LIBERO 和 LIBERO-plus 数据集上评估此设置。由于这是一项实验性试验,对于这两个数据集,仅使用 LIBERO 数据集的 1/10 进行训练。此外,还使用相同的架构进行真实世界实验。

主流 VLA 实验。将 V-JEPA 2 表示融入 LIBERO 和 RoboTwin2.0 上的主流 VLA 模型,进一步评估方法。其实现标准的 OpenVLA-OFT(Kim,2025a)配置之一,使用第三人称图像和语言指令作为输入,采用并行解码、动作分块和连续动作预测,并使用 l1 回归损失。对于 LIBERO,遵循 OpenVLA-OFT 实现提供的官方数据预处理流程。对于 RoboTwin2.0,用官方的 50 条干净轨迹进行训练,并在干净和领域随机化设置下进行评估。在两个基准测试中,每隔八个解码器层插入一个门控交叉注意层。

训练详情。尽可能遵循官方基线训练设置,仅调整批大小以适应有限的计算资源。对于 LIBERO 和 LIBERO-plus,用批大小为 16 训练方法和基线模型。Basic VLA 训练 40 个 epoch 以确保收敛,而 OpenVLA-OFT 则按照官方计划训练 15 万步。对于 RoboTwin2.0,用批大小为 8,训练约 10 万步。对于新引入的融合层,设置更小的学习率,为 1×10⁻⁵ 至 1×10⁻⁴,而 OpenVLA-OFT 中原始 VLA 参数的学习率为 5×10⁻⁴。

赞(0)
未经允许不得转载:171主机测评 » JEPA-VLA:VLA模型需要视频预测嵌入
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址