欢迎光临
我们一直在努力

World-Gymnast:在世界模型中用强化学习训练机器人

26年2月来自NYU、NYU上海分校和加州伯克利分校的论文“World-Gymnast: Training Robots with Reinforcement Learning in a World Model”。

机器人通过与物理世界交互进行学习的根本瓶颈在于物理交互的成本。两种替代方案——基于专家演示的监督微调(SFT)和基于软件模拟器的强化学习(RL)——都受到可用专家数据量和模拟与真实操作之间差距的限制。随着近年来从真实世界视频动作数据中学习的世界模型出现,提出这样一个问题:在世界模型中训练策略是否比监督学习或软件模拟更能有效地提升真实机器人的性能?World-Gymnast,通过在动作条件化的视频世界模型中部署视觉-语言-动作(VLA)策略,并用视觉-语言模型(VLM)奖励部署结果,从而实现对 VLA 策略的强化学习微调。在 Bridge 机器人平台上,World-Gymnast 的性能比 SFT 的性能高出 18 倍,比软件模拟器的性能高出 2 倍。更重要的是,World-Gymnast 展示基于世界模型强化学习 (RL) 的诸多强大功能,包括:使用世界模型中的不同语言指令和新场景进行训练;在测试时在新场景中进行训练;以及在线迭代改进世界模型和策略。


用于机器人学习的视频生成。基于视频的机器人学习(Nair,2022;Bahl,2022;Shao,2021;Chen,2021;Pari,2022)实现视觉表征学习、目标提取、规划(Finn & Levine,2017;Kurutach,2018)以及模仿专家动作(Fang,2019;Wang,2023;Mani,2024)。近期研究将决策过程重定义为文本条件视频生成任务,从而能够从视频预测中学习策略(Du et al., 2024; Ko et al., 2023; Wen et al., 2023; Du et al., 2023; Ajay et al., 2024),并使用生成模型来模拟智体与环境的交互(Yang et al., 2023)。这些研究大多将生成的视频计划作为视觉动作,并训练独立的逆动力学模型从生成的视频中提取机器人动作。虽然文本-到-视频的生成对于长时程规划有效,但如何改进这些以视频生成作为策略的模型尚不明确。本文研究仅将视频生成作为环境,并结合强化学习和生成的展开式来提升策略性能的问题。值得注意的是,World-Gymnast 原则上可用于改进除 VLA 策略之外的任何策略,包括通过视频生成进行参数化的策略。

使用世界模型进行策略评估。最近的研究表明,从真实机器人数据中学习到的世界模型可以近似真实机器人的执行结果,因此可用于评估机器人策略(Quevedo,2025;Guo,2025;Tseng,2025;Li,2025b)。虽然在世界模型中评估策略无疑是世界模型的一个重要应用,但本文关注的是使用世界模型改进策略性能的端到端问题,其效果可以在真实机器人上进行测试。

基于视频世界模型的强化学习。本文工作与 Zhu (2025)的工作最为相似, 其利用强化学习(RL)改进视频世界模型中的策略,但本文专注于使用开源VLA策略(OpenVLA)、世界模型(WorldGym)和评估平台(AutoEval)在易于访问的评估环境中进行真实世界评估。本文还着重探索强化学习在世界模型中的涌现能力,包括从任何初始帧使用新的语言指令进行训练、测试时训练以及迭代改进世界模型和策略。

提出的World-Gymnast的概述,如图所示:该策略基于初始帧和语言指令指定的任务进行训练。训练过程中,策略输出动作,这些动作随后被传递给世界模型,WorldGym (Quevedo et al., 2025),该模型生成虚拟的展开轨迹。这些展开轨迹随后被传递给VLM,该模型返回一个二元任务完成奖励。该奖励用于更新策略。训练完成后,用 AutoEval (Zhou et al., 2025) 系统在真实机器人上评估该策略。AutoEval 生成的真实世界展开轨迹(帧-动作序列)可进一步用于改进特定环境下的世界模型。

请添加图片描述

基于模型的GRPO与世界模型展开

为了优化策略π_θ,World-Gymnast使用Quevedo(2025)学习的世界模型T。采用组相对策略优化(GRPO)(Shao,2024),这是一种使用基于组分数归一化来估计Aˆ的策略-梯度算法。

对于给定的任务指令g和初始观测值o_0,通过在世界模型Tˆ中展开策略π_θ来生成一组K个独立的轨迹 {τ_1, . . . , τ_K }。具体来说,对于第k条轨迹,策略采样一个动作a_t,k ∼ π_θ (· | o_t, k, g),世界模型预测下一个观测值o_t+1,k ∼ Tˆ(o_t,k, a_t,k)。此过程重复进行,直至到达时间范围 H,从而得到轨迹 τ_k = (o_0,k, a_0,k, …, o_H,k)。展开完成后,采用 VLM模型 Rˆ 为每条轨迹 r_k = Rˆ(τ_k, g) 分配一个二元任务完成奖励。为了计算优势,将 K 个输出组视为基线。计算该组内奖励的均值和标准差,然后通过归一化计算第 k 条轨迹的优势。

将轨迹级优势分配给该轨迹内的每个时间步 t。也就是说,对于所有 t ∈ [0, H − 1],Aˆ_t,k = Aˆ_k。最后,使用基于计算优势进行裁剪的 PPO 风格目标函数来优化策略 π_θ。损失函数定义如下:
请添加图片描述

借鉴 Li (2025a) 使用强化学习 (RL) 成功训练 VLA 的训练设置,采用他们的一些技术:1) 舍弃 KL 惩罚项;2) 动态采样以过滤掉奖励方差为零的组;3) 提高 GRPO 的截断值;4) 在展开训练 (rollout) 期间使用更高的温度对动作进行采样。这些技巧有助于稳定训练过程并改善训练期间的探索能力。

世界模型中的多样化训练场景

在多样化的数据集上预训练的世界模型,能够仅使用图像和语言指令生成多样化的训练配置(例如,任务和初始观测)。这比为每个新配置设置基于软件的模拟提供更大的灵活性。现在,探索利用 World-Gymnast 实现的在多样化配置中训练策略的一系列可能性。

从任意帧进行训练。可以使用与世界模型训练分布足够接近的任意帧作为初始观测 o_0,通过强化学习 (RL) 训练策略,然后展开策略 π、世界模型 Tˆ 和奖励模型 Rˆ,以提供基于此初始配置的学习信号。与受限于专家演示数量的 SFT 相比,这种灵活性显著增加可用于强化学习的有效训练数据量。从任意帧进行强化学习还使策略能够学习恢复行为,从而提高策略的鲁棒性。

在新语言指令上进行训练。通过修改与同一初始帧关联的语言指令,可以进一步扩展训练数据。例如,可以给VLM 一个初始帧,并要求机器人根据该初始帧执行合理的任务。然后,将这些合理的任务作为语言指令提供给VLA模型策略,以评估该策略在OOD语言任务上的性能,并通过强化学习(RL)进一步改进该策略在OOD语言任务上的表现。这使得该策略能够针对新任务进行训练,并与环境中先前存在但未显式交互的对象进行交互。先前的策略评估工作表明,预训练的VLA策略通常无法很好地遵循OOD语言指令(Quevedo,2025)。可以通过在世界模型中进行强化学习后训练来克服VLA的这些局限性。

带干扰的训练。为了提高策略对无关视觉干扰的鲁棒性,利用诸如 Nano Banana(Google,2025)之类的图像编辑工具,在输入图像帧中合成额外的物体作为干扰物。在多样化的干扰物上训练策略,可以增强策略在实际部署过程中遇到此类干扰物时的鲁棒性,并提高其在杂乱场景中的性能。这可以弥合演示机器人和能够在任何人的凌乱家庭环境中工作的机器人之间的差距。

从新帧进行测试-时的训练

由于 World-Gymnast 允许策略仅从初始帧开始部署,因此当在测试时向策略呈现新帧时,策略可以通过从测试帧开始在世界模型中运行强化学习训练,从而以计算量换取更高的策略性能。这使得策略能够快速适应新场景,同时避免收集真实世界交互数据的成本和风险。

迭代式世界模型与策略改进

当策略部署过程中遇到的视觉观测结果与世界模型的原始训练分布偏差过大时,直接在世界模型中部署策略可能会导致建模误差累积。受经典 Dyna 式算法(Sutton,1991)的启发,World-Gymnast 允许采用迭代训练过程,交替地改进策略和世界模型。

具体而言,当前策略可以部署(通过推理-时规模化TTS或使用世界模型作为奖励函数的测试-时训练TTT)以收集新的环境交互,然后将这些交互纳入世界模型以进一步微调。更新后的世界模型随后用于生成改进的预期部署,以进行策略优化。这种数据循环使世界模型能够逐步适应策略引起的状态分布,同时使策略能够受益于世界模型日益精确的长期预测。


世界模型上的快速推理。强化学习 (RL) 训练流程中的一个主要瓶颈是世界模型推理的延迟。如果没有优化,时间注意力层会在每一步都重新计算整个帧历史的注意。通过引入KV缓存(如算法 1 所述)改进 WorldGym (Quevedo,2025) 架构以实现快速推理(Pope,2023)。这一改进显著降低每步的延迟,尤其是在上下文较长的情况下,从而实现原本无法实现的长时域强化学习训练。在实践中,当并行生成 20 条轨迹并跨越 40 帧时,展开时间减少了 10 倍。
请添加图片描述

OpenVLA-OFT 作为基础模型。在所有实验中,用 OpenVLA-OFT (Kim,2025) 作为基础模型。 OpenVLA-OFT 基于 OpenVLA (Kim,2024) 构建,并提供一种旨在提升训练效率和性能的微调方案。具体而言,它支持并行解码、动作分块和连续动作表示,从而实现更快、更高效的推理和学习。用 Bridge Dataset V2 (Walke,2023) 对 OpenVLA-OFT 进行微调,其初始状态为在 Open X-Embodiment 数据集 (Vuong,2023) 上预训练的 OpenVLA 检查点。

世界模型实现细节。WorldGym (Quevedo,2025) 在整个实验中用作基于世界模型的模拟器。它使用来自 Stable Diffusion 3 (Esser,2024) 的预训练 VAE 将 256 × 256 RGB 图像帧编码到潜空间中。 WorldGym 的底层世界模型是一个 16 层 Transformer 模型,隐藏层维度为 1024,并包含 16 个注意力头。除非另有说明,否则遵循 WorldGym 的默认配置,包括视觉编码、世界模型架构和 rollout 设置。使用的世界模型基于在 Open-X Embodiment 数据集(Vuong,2023)上训练的预训练检查点进行初始化。WorldGym 将动作表示为 10 维向量。在实验中,用前 7 个维度来匹配 OpenVLA(Kim,2024)的动作空间,该空间由一个 6 维末端执行器姿态和一个二元夹爪状态组成。WorldGym 使用固定的上下文长度 20 帧进行训练;在更长的 rollout 过程中,它会使用最近 20 帧的滑动窗口作为条件。

强化学习训练实现细节。用 WorldGym (Quevedo et al., 2025) 中的组相对策略优化 (GRPO) (Shao et al., 2024) 来训练策略。对于每个任务,训练从单个观测帧和一条语言指令初始化。策略在世界模型中最多展开 40 步,并使用 GPT-4o (Hurst et al., 2024) 为每次展开分配一个二元任务完成奖励。动作以长度为 5 的块生成,策略更新遵循裁剪策略梯度目标。所有强化学习训练均在 WorldGym 中完成。

分布外语言数据集。为了评估对语言分布偏移的鲁棒性,修改 OpenVLA 任务子集 (Kim et al., 2024) 的任务指令来构建分布外 (OOD) 语言训练分布。底层场景和对象保持不变;仅修改自然语言指令以描述新的交互。OOD语言数据集包含四种新定义的语言变型,应用于现有的OpenVLA任务:(a)将装有葡萄的罐子移到晾干架上;(b)从晾干架上拿起罐子,放在水槽外的台面上;(c)将盘子放在晾干架上;(d)将黄玉米放入红杯子中。在强化学习(RL)训练过程中,将此OOD语言数据与OpenVLA评估任务集的训练集进行混合,在初始帧中,原始语言指令和OOD语言指令的比例为50/50。


实验设置

任务和流程。用 Kim (2024) 中使用的精选评估数据集来评估 World-Gymnast 的有效性。该数据集遵循 BridgeData V2 (Walke,2023) 的设置,并使用 WidowX 机器人,旨在测试策略在视觉、运动、物理和语义变化以及语言基础方面的泛化能力,共包含 17 个任务。

进一步利用 World-Gymnast 的数据扩展功能,例如图像编辑、语言增强和新的任务设置,以提高后训练的强化学习策略泛化能力。使用 World-Gymnast 进行训练时,任务只需要初始帧和语言指令。在训练过程中,World-Gymnast 会在 WorldGym 中执行策略最多 40 步,并由 GPT-4o (Hurst,2024) 为每次执行分配一个二元任务完成奖励。

训练完成后,在 WorldGym(Quevedo,2025)上评估策略的性能,以估计真实机器人的性能并确保策略在测试中安全,除非另有说明,否则均采用其默认配置。最后,在 AutoEval(Zhou,2025)上运行该策略。AutoEval 是一个真实机器人评估框架,目前支持 2 种设置下的 4 个任务。AutoEval 对每个策略-任务组合进行 10 次试验;重复此评估 5 次以估计标准误差。

基础模型。成功的强化学习微调需要一个相当不错的初始策略。为此,用 OpenVLA-OFT(Kim,2025)作为基础模型。 OpenVLA-OFT 提供一个优化的微调方案,用于构建基于 OpenVLA (Kim,2024) 的模型。OpenVLA 最初是在 Open X-Embodiment 数据集 (Vuong,2023) 上训练的。本文用 BridgeData V2 (Walke,2023) 来微调基础模型。借鉴 (Li,2025a) 的思路,对 OpenVLA-OFT 的官方实现进行一些修改:1) 禁用本体感觉和辅助摄像头输入,以匹配策略所使用的观测空间;2) 使用 LLAMA-2 (Touvron,2023) LM 头部作为动作头部,而不是默认的 L1 损失头部,以获得强化学习 (RL) 所必需的动作概率。对于 WorldGym 数据集,用一个在 Open X-Embodiment 数据集上预训练的 6 亿参数变型。

训练详情。对于强化学习训练,用 4 个 NVIDIA H200 GPU(每个 140GB)进行全参数微调,耗时 1-2 天。用的训练参数如下:学习率 5 × 10⁻⁶,组大小 8,训练批次大小 20,动作块长度 5,剪辑比例(εhigh = 0.28,εlow = 0.2),温度 1.6。

赞(0)
未经允许不得转载:171主机测评 » World-Gymnast:在世界模型中用强化学习训练机器人
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址