欢迎光临
我们一直在努力

【Nature 2025】DreamerV3:通过世界模型掌握多样领域|从通用智能体世界模型视角

摘要

本文解读 Nature 2025 论文《Mastering Diverse Domains through World Models》(DreamerV3)。该论文提出第三代 Dreamer 世界模型强化学习算法,通过融合世界模型预测、隐空间想象训练与三项鲁棒性技术,用单一固定超参数配置解决超过 150 个任务、8 大领域的通用控制问题,其特别之处在于首次无人类数据、无课程从零采集到 Minecraft 钻石。实验表明 7 大基准全部超越最强专用算法(Atari 830% vs MuZero 693%,数据效率提升超 1000%),为通用人工智能提供了可复现的范式借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • DreamerV3 和 DreamerV1/V2 有什么区别?
    • DreamerV3 为什么能在 Minecraft 从零采到钻石?
    • 一套超参数真的能跨所有领域吗?
    • DreamerV3 的计算成本高吗?
    • 世界模型和 MuZero 的模型有什么区别?
    • 模型越大越好吗?
  • 参考链接

论文基本信息

项目内容
标题(英文) Mastering Diverse Domains through World Models
标题(中文) 通过世界模型掌握多样领域
作者 Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap
机构 Google DeepMind · University of Toronto
会议 Nature 2025
arXiv https://arxiv.org/abs/2301.04104
项目网站 https://danijar.com/project/dreamerv3/

背景与动机

为什么这个问题重要?强化学习算法的可迁移性是瓶颈:虽然 PPO、SAC 等算法在各自擅长的领域表现良好,但换一个应用领域往往需要大量人工调参和实验——从视频游戏迁移到机器人任务时,超参数、奖励尺度、表示正则化都要重新配置。这种脆性阻碍了 RL 在真实世界的大规模应用。

现有工作的局限非常明显:PPO 通用但需要大量经验,SAC 在连续控制上高效但熵尺度难以调;MuZero 在 Atari 和棋类上极强但未开源、组件复杂;Gato 能拟合多任务演示但必须依赖专家数据;Minecraft 方向的 VPT 用了 720 块 GPU 和 9 天训练,还需要人类键盘鼠标数据预训练;课程学习方法(Kanitscheider 等)则需要专家设计课程。本文的关键差异是:DreamerV3 单卡 A100、无人类数据、开箱即用,把"逐领域调参"彻底变成"一套配置走天下"。

从历史脉络看,DreamerV3 是 PlaNet(2018,RSSM 隐空间规划)→ DreamerV1/V2(2019–2021,隐空间想象训练、离散表示制霸 Atari)→ DreamerV3(2023,固定超参数横扫 150+ 任务)三代演进的集大成者,随后 DayDreamer(2022)走向实物机器人、Dreamer 4(2025)实现可扩展实时世界模型,并催生了 UniPi、Dreamitate、IRASim、WMPO 等机器人/驾驶世界模型谱系(2023–2026)。用 ResearchStudio-Idea 框架看,本文命中三个高 Oral 率创新模式:P5 统一异构输入到同一空间(8 领域异构任务归一为单一配置,社区高引用);P7 制造监督信号(世界模型自监督重建目标主导表示学习,NeurIPS 偏好 +3.7pp);P4 混淆隔离诊断工具(14 任务系统消融逐项隔离鲁棒性技术的独立贡献,RL 领域 Oral 率 93%)。

研究主线:从问题到结论

Mermaid 图 1

图 7:DreamerV3 研究主线——从 RL 调参瓶颈出发,经世界模型与鲁棒性设计,通向通用智能体范式。(Mermaid 流程图)

基准/方法设计

DreamerV3 的目标函数可以概括为三网络的联合学习:世界模型最小化预测损失 $\\mathcal{L}(\\phi)=\\beta_{\\mathrm{pred}}\\mathcal{L}{\\mathrm{pred}}+\\beta{\\mathrm{dyn}}\\mathcal{L}{\\mathrm{dyn}}+\\beta{\\mathrm{rep}}\\mathcal{L}{\\mathrm{rep}}$(权重 1、1、0.1),评论家拟合 $\\lambda$-returns $R^\\lambda_t = r_t + \\gamma c_t((1-\\lambda)v_t + \\lambda R^\\lambda{t+1})$,演员最大化熵正则化回报 $\\mathcal{L}(\\theta) = -\\sum_t \\mathrm{sg}((R^\\lambda_t – v_\\psi(s_t))/\\max(1,S))\\log\\pi_\\theta(a_t|s_t) + \\eta\\mathcal{H}[\\pi_\\theta]$。

DreamerV3 八领域任务总览:Atari / ProcGen / DMLab / Atari100k / BSuite / 本体控制 / 视觉控制 / Minecraft

图 1:8 大评测领域总览——覆盖连续/离散动作、像素/向量输入、稠密/稀疏奖励、2D/3D 世界。

设计核心是三网络 + 鲁棒性四件套:世界模型(RSSM)从回放经验学习环境动态,作为可微分"快速模拟器";评论家预测分布式 $\\lambda$-returns;演员在模型想象的隐空间轨迹上学习。四项鲁棒性技术分别是:symlog/symexp twohot 变换兼容任意量级奖励;free bits KL 平衡(裁剪至 1 nat ≈ 1.44 bits)消除跨域正则化调参;return 归一化(5–95 分位 EMA,$S = \\mathrm{EMA}(\\mathrm{Per}(R^\\lambda_t,95)-\\mathrm{Per}(R^\\lambda_t,5), 0.99)$)让小回报不放大噪声;分布式评论家(指数间隔分类箱 + 零初始化输出层)稳定多模态回报预测。正是这些设计让熵系数固定为 $\\eta=3\\times10^{-4}$ 也能跨域工作。

分类全景

Mermaid 图 2

图 8:DreamerV3 三网络结构分类全景——世界模型、评论家、演员并发训练,16K 批量隐空间想象。(Mermaid 流程图)

方法细节

方法的核心是在隐空间而非像素空间做规划:世界模型把感官输入 $x_t$ 编码为随机表示 $z_t$,序列模型以循环状态 $h_t$ 预测未来表示并重建输入;演员-评论家只在抽象表示轨迹上训练,无需解码观测,因此能大规模并行(单卡 16K 批量,媲美专用模拟器)。同时,交互、想象、学习三者解耦:数据收集与优化并行,没有训练频率超参数。

世界模型学习:编码器将感官输入编码为离散表示 z_t,序列模型以循环状态 h_t 预测未来表示并重建输入

图 2:世界模型学习流程——RSSM 五组件(编码器、序列模型、动态预测器、奖励预测器、解码器)。

演员-评论家学习:仅在世界模型预测的抽象表示轨迹上训练,无需解码观测

图 3:演员-评论家学习——隐空间想象训练的关键设计。

附录 A 补充了 RSSM 细节:表示用 softmax 分布 + 直通梯度,并混合 1% uniform 防止熵崩塌;动态损失 $\\max(1, \\mathrm{KL}[\\mathrm{sg}(q)||p])$ 与表示损失 $\\max(1, \\mathrm{KL}[q||\\mathrm{sg}(p)])$ 用 free bits 裁剪;奖励与价值输出权重零初始化,加速早期学习。

实验设计与结果

评测协议:全部 DreamerV3 用同一套超参数,每任务单卡 A100;与领域内最优专用算法 + 高质量固定超参 PPO 对比。任务覆盖 8 类:Atari 57 个游戏 200M 帧、ProcGen 16 个游戏 50M 帧、DMLab 30 个任务 100M 帧、Atari100k 26 个游戏 400K 帧、本体控制 18 个任务 500K 步、视觉控制 20 个任务 1M 步、BSuite 23 个环境 468 种配置、Minecraft 100M 步从零开始。

领域任务数最强基线DreamerV3
Atari(Gamer 中位) 57 693%(MuZero) 830%
Atari100k(均值) 26 96%(IRIS) 125%
ProcGen(归一化均值) 16 64.9(PPG) 66.0
DMLab(人类归一化) 30 IMPALA@1B 步 71.4% @100M
本体控制(任务均值) 18 801(D4PG) 871
视觉控制(任务均值) 20 770(DrQ-v2) 861
BSuite(任务均值) 23 60%(Boot DQN) 66%

基准分数总览:固定超参数下 DreamerV3 全面超越调参后的专用算法,并大幅超越 PPO

图 4:7 大基准分数总览——Atari、ProcGen、DMLab、Atari100k、本体控制、视觉控制、BSuite 全超越。

Minecraft 结果:DreamerV3 首次从零采集钻石;基线止步于铁镐等高级物品

图 5:Minecraft 里程碑——DreamerV3 首个从零(无人类数据/课程)采到钻石的算法。

消融与扩展:各鲁棒性技术贡献;模型规模与 replay ratio 的稳健扩展

图 6:消融与扩展——KL 目标最重要,其次 return 归一化与 symexp twohot;12M→400M 参数全部稳定学习。

附录 B 补充了 Minecraft 细节:每局程序生成的无限 3D 世界,回合最长 36000 步(30 分钟),需从稀疏奖励中依次发现 12 件物品(伐木→木镐→石镐→铁镐→…→钻石);DreamerV3 单卡 A100、9 天、100M 步全部智能体发现钻石,而 VPT 需要 720 卡 9 天 + 人类数据,课程方法需要专家课程——多个强基线能推进到铁镐但无一发现钻石。

结果对比总结

Mermaid 图 3

图 9:结果对比总结——DreamerV3 在数据效率与绝对分数上的双重优势。(Mermaid 流程图)

关键发现

  • 全领域超越:7 大基准全部超越最强专用算法,Atari 中位 830% vs MuZero 693%,BSuite 66% vs 60%,本体控制 871 分 vs D4PG 801 分。
  • 数据效率飞跃:DMLab 用 100M 帧达到 IMPALA/R2D2+ 在 1B 步的水平,数据效率提升超过 1000%。
  • Minecraft 圣杯达成:首个无人类数据、无课程从零采钻石的算法,100M 步、单卡 A100 训练 9 天(VPT 需 720 卡 + 人类数据)。
  • 消融归因清晰:14 任务消融中每项鲁棒性技术均有贡献,KL 目标最重要,其次 return 归一化与 symexp twohot。
  • 世界模型主导表示:停止重建梯度使表示劣化——任务无关的自监督预测目标支撑了主要性能。
  • 可预测扩展律:12M→400M 参数 6 种模型规模全部稳定学习,模型越大分数越高、所需交互越少。

局限性

  • 非最优专用:固定配置在单任务上可能低于极致调参的专用算法,通用性以局部最优为代价。
  • 算力门槛:大规模世界模型训练(如 Minecraft 100M 步)仍需单卡 A100 数天,算力受限场景难落地。
  • 像素级输入瓶颈:从像素学习 12 物品科技树耗时极长(人类约 20 分钟 vs 机器 100M 步)。
  • 单一世界模型未实现:当前每环境单独训练世界模型,尚不能跨域共享一个模型。

常见问题(FAQ)

DreamerV3 和 DreamerV1/V2 有什么区别?

DreamerV1(ICLR 2020)提出隐空间想象训练,DreamerV2(ICLR 2021)引入离散表示在 Atari 上表现出色,但都需要按环境调参;DreamerV3 通过 symlog 变换、free bits KL 平衡和 return 归一化三项鲁棒性技术,实现了跨域固定超参数。

DreamerV3 为什么能在 Minecraft 从零采到钻石?

稀疏奖励、长时域探索和开放世界是三重挑战。DreamerV3 靠世界模型的长期想象做远见探索:在隐空间推演未来场景,配合回报归一化(5–95 分位 EMA)避免稀疏奖励放大噪声,熵正则保证持续探索。

一套超参数真的能跨所有领域吗?

是的,150+ 任务、8 大领域(Atari、ProcGen、DMLab、Atari100k、BSuite、本体控制、视觉控制、Minecraft)全部使用同一配置,包括连续/离散动作、像素/向量输入、稠密/稀疏奖励。

DreamerV3 的计算成本高吗?

每个任务单卡 A100:Atari 约 7.7 GPU 天、DMLab 约 2.9 GPU 天、Minecraft 约 8.9 GPU 天(200M 参数模型)。相比 VPT 的 720 卡 9 天已大幅降低门槛。

世界模型和 MuZero 的模型有什么区别?

MuZero 用价值预测模型做规划且未开源;DreamerV3 的 RSSM 世界模型预测完整的环境动态(表示、奖励、继续信号)并重建输入,演员-评论家在隐空间想象中训练,实现开源、可复现。

模型越大越好吗?

实验显示 12M→400M 参数 6 种规模全部稳定学习,更大的模型分数更高且所需交互更少——提供了一种可预测的"按算力预算换性能"扩展路径。

参考链接

  • arXiv 原文:https://arxiv.org/abs/2301.04104
  • 项目网站(开源实现):https://danijar.com/project/dreamerv3/
  • DreamerV2(ICLR 2021):https://arxiv.org/abs/2010.02193
  • PlaNet(ICML 2019):https://arxiv.org/abs/1811.04551
  • MuZero(Nature 2020):https://arxiv.org/abs/1911.08265
  • VPT(NeurIPS 2022):https://arxiv.org/abs/2206.11795

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

赞(0)
未经允许不得转载:171主机测评 » 【Nature 2025】DreamerV3:通过世界模型掌握多样领域|从通用智能体世界模型视角
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址