公司动态

世界模型之DreamerV3详解:不调学习超参数也能跨 150+ 个任务——如何在世界模型里练策略

📅 2026/7/28 22:08:21
世界模型之DreamerV3详解:不调学习超参数也能跨 150+ 个任务——如何在世界模型里练策略
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读强化学习算法往往在熟悉的基准上表现很好一换到奖励尺度、观测形式或动作空间不同的环境就需要重新调学习率、熵系数、损失权重和网络结构。DreamerV3 把“换任务后少调参”设为核心目标用同一组学习超参数覆盖图像与状态输入、离散与连续动作、稠密与稀疏奖励以及 2D、3D 和程序生成环境。DreamerV3 仍沿用 Dreamer 系列的基本路线。RSSM 世界模型从真实经验中学习潜状态及其动力学actor 和 critic 不在真实环境里反复试错而是在世界模型生成的潜状态轨迹中训练。V3 的主要进步不是换掉这套架构而是系统解决不同任务之间的数值尺度与优化稳定性free bits 与不对称 KL 损失平衡表征和动力学1% uniform mixture 防止离散分布过度确定百分位回报归一化协调探索强度symlog 与 two-hot 让奖励和价值跨数量级也能稳定预测。论文在 8 类、150 多个任务上比较统一配置的 DreamerV3、PPO 和针对各基准调优的专家算法。DreamerV3 整体超过专家方法并在所有汇总领域上明显超过统一配置的 PPO。更醒目的结果来自 Minecraft不使用人类演示或课程学习10 次训练都在 1 亿环境步内发现钻石。猫先生认为DreamerV3 的核心价值不只是“在模型里想象未来”而是把大量看似琐碎的稳定化技巧组织成一套能跨环境复用的训练协议。通用性来自对尺度、随机性和损失竞争关系的控制而不只是来自更大的世界模型。论文标题Mastering Diverse Domains through World Models论文地址https://arxiv.org/abs/2301.04104项目主页https://danijar.com/project/dreamerv3/GitHubhttps://github.com/danijar/dreamerv3Nature 版本https://www.nature.com/articles/s41586-025-08744-2原文脉络原文先用跨域强化学习的调参成本提出问题。Learning Algorithm 是方法主体依次讲 RSSM 世界模型、critic、actor 与鲁棒预测。Results 覆盖跨域基准、Minecraft、消融和模型扩展Previous Work 区分 PPO、SAC、MuZero、Gato 以及依赖人类数据的 Minecraft 路线Conclusion 则把方向延伸到视频预训练与跨域共享世界模型。Methods 和补充材料给出基准协议、算力、模型尺寸与完整超参数。1. Introduction通用算法首先要经得起尺度变化连续控制、Atari、稀疏奖励和三维导航通常由不同算法占据优势。PPO 的适用面较广但数据效率和最终性能经常弱于专用方法专用方法又依赖大量领域经验。DreamerV3 因此不把“某个基准上的最高分”作为唯一目标而是要求同一学习配方在陌生领域也能直接工作。图 1统一配置的 DreamerV3 在 Atari、ProcGen、DMLab、Minecraft、Atari100k、状态控制、视觉控制和 BSuite 上与统一 PPO 及调优专家算法比较右侧给出 Minecraft 技术树进展。来源原论文 Figure 1。图 1 展示了论文的主要经验主张DreamerV3 在各类任务汇总分数上超过统一配置的 PPO并整体达到或超过针对单一领域调优的方法。这里的“统一”主要指学习目标及其超参数不随领域改写计算配置并非完全相同后文会进一步区分。2. Learning Algorithm世界模型、critic 与 actor 并行学习DreamerV3 包含三个同时更新的网络世界模型从经验回放中学习潜状态、动力学、奖励和 episode 是否继续critic判断潜状态下未来回报的分布actor选择能让 critic 给出更高价值的动作。智能体与环境交互时只采样 actor 的动作不做在线树搜索。计算量更大的未来展开发生在训练阶段从回放序列编码出的潜状态出发actor 提出动作世界模型预测下一状态、奖励和继续概率critic 再为整段想象轨迹估值。2.1 World Model LearningRSSM 把观察变成可预测状态图 2真实观察经编码器形成离散潜状态 z循环状态 h 汇总历史解码器重建观察动作与潜状态共同推动 h 向前更新。来源原论文 Figure 3(a)。世界模型采用 Recurrent State-Space ModelRSSM。它把状态拆成两部分确定性的循环状态h负责累积历史与动作随机的离散潜状态z负责表达当前观察中无法仅靠历史确定的信息。看到真实观察时encoder 根据h与观察产生 posteriorq(z|h,x)在想象阶段没有新观察dynamics predictor 只能根据h产生 priorp(z|h)。二者的差异决定世界模型能否脱离真实画面继续向前滚动。h与z拼成完整模型状态并用于完成三类预测重建输入、预测奖励、预测 episode 是否继续。训练目标也分为三部分prediction loss确保潜状态包含重建观察、奖励和终止所需的信息dynamics loss让 prior 追上由真实观察得到的 posteriorrepresentation loss反过来推动 posterior 变得更容易被 prior 预测。DreamerV3 对后两项使用不同方向的 stop-gradient权重分别为 1 和 0.1。较小的 representation loss 避免潜表示为了“容易预测”而抛弃过多观察信息。2.2 Free bits 与 1% unimix不让潜变量塌缩或变得过度自信简单画面中的单个像素可能影响任务复杂三维画面又包含大量与控制无关的纹理。固定 KL 权重很难同时适应二者。DreamerV3 把 dynamics loss 和 representation loss 的下限设为 1 natKL 已经足够小时不再继续挤压潜变量把优化重心交还给重建和任务预测。离散 posterior 与 prior 还会混入 1% 的均匀分布形成 99% 网络输出与 1% uniform 的 mixture。任何类别都不会被压到绝对零概率KL 梯度不容易因两个过度确定、却彼此冲突的分布而突然爆炸。猫先生认为free bits 与 unimix 分别守住了潜空间的两条边界前者防止“为了可预测而没有信息”后者防止“为了确定而没有余地”。DreamerV3 能跨域很大程度上依赖这种对表示容量与分布尖锐度的显式约束。2.3 Critic Learning在想象轨迹上学习回报分布图 3从真实经验编码出的初始状态开始actor 产生动作世界模型预测后续 z、h 与奖励critic 为想象状态估值后续步骤不再读取真实画面。来源原论文 Figure 3(b)。每次想象展开长度为 15 个未来动作折扣因子为 0.997对应约 333 步的有效折扣范围。有限展开之外的回报由 critic bootstrap并通过lambda0.95的 return 折中短期模型奖励与长期价值估计。critic 不直接回归一个标量而是预测分布。奖励稀疏、随机出生点和程序生成关卡都可能让回报呈现多峰分布式价值比单一高斯更合适。critic 同时从想象轨迹和回放轨迹学习并用自身参数的指数移动平均结果做正则化减少“目标由自己不断改变”带来的震荡。actor 使用同一套 REINFORCE 形式处理离散与连续动作。优势项告诉策略哪些动作更有价值熵项维持探索。难点在于不同环境的回报可能从小数到数千不等固定熵系数只有在回报梯度被统一到近似尺度后才有意义。2.4 Return Normalization、symlog 与 two-hot统一不同数量级DreamerV3 用 batch 内回报的第 95 百分位减去第 5 百分位作为动态尺度并通过 EMA 平滑。分母最低限制为 1避免稀疏奖励阶段的微小噪声被放大。相比标准差归一化百分位范围不容易被极端轨迹主导也不会在绝大多数回报为零时失控。对可正可负、跨度很大的观察值和预测目标论文引入symlog(x)sign(x)·log(|x|1)。它在零附近近似线性对大数进行对称压缩又保留正负号。reward head 与 critic 进一步使用 symexp 间隔的离散桶和 two-hot 标签连续目标由相邻两个桶共同表示梯度大小不再与原始数值量级直接绑定。这几项技巧解决的是同一问题的不同侧面不稳定来源DreamerV3 的处理观察或目标跨度过大symlog / symexp连续回报分布多峰exponentially spaced bins two-hot不同任务的回报尺度不同5%—95% 百分位回报归一化稀疏奖励时分母接近零归一化分母下限 1KL 过小导致表征塌缩1 nat free bits离散分布过度确定1% uniform mixture图 4世界模型读取 5 帧上下文和后续动作随后在不访问中间真实图像的情况下预测 45 帧画面逐渐模糊但空间布局和运动趋势仍被保留。来源原论文 Figure 4 的 DMLab 子图。开环预测说明 RSSM 学到了一定空间与时间结构但 DreamerV3 并不以像素清晰度作为最终目标。actor 和 critic 直接消费抽象状态只要潜动力学保留影响奖励和动作选择的结构生成画面出现模糊也未必破坏策略学习。3. Results固定学习配方覆盖八类基准实验覆盖连续和离散动作、图像和低维状态、稠密和稀疏奖励以及确定性、随机性与程序生成环境。主要协议如下基准任务数环境步数模型规模Atari57200M200MProcGen1650M200MDMLab30100M200MAtari100k26400K200MProprio Control18500K12MVisual Control201M12MDMLab 中DreamerV3 用 1 亿环境步超过了以 10 亿步计的 IMPALA 和 R2D2 对照Visual Control 中超过 DrQ-v2 与 CURL状态控制和 BSuite 也刷新了汇总表现。Atari100k 的比较需更谨慎论文指出 EfficientZero 使用在线搜索、优先回放、超参数调度和提前重置关卡环境协议并不完全等价因此主要与其余方法比较。3.1 Minecraft从稀疏里程碑奖励走到钻石Minecraft Diamond 每局最长 36000 步。智能体必须依次获得木头、木板、木棍、工作台、木镐、圆石、石镐、铁矿、熔炉、铁锭、铁镐和钻石。每个里程碑每局只奖励一次后期奖励与开局相隔很远。图 5IMPALA、Rainbow 和 PPO 能推进到铁镐但只有 DreamerV3 在 1 亿环境步内稳定发现钻石10 个 DreamerV3 seed 最终都成功。来源原论文 Figure 5。单次 Minecraft 训练使用一块 A100约 8.9 GPU-days。与依赖人类视频和大规模行为克隆的 VPT 不同DreamerV3 没有使用人类演示或手工课程。不过这也不是纯 RGB、鼠标键盘级的人类玩法环境提供 64×64 第一视角图像、400 多项库存计数、历史里程碑、当前装备、生命、饥饿和呼吸状态并采用 MineRL 的抽象合成动作。钻石结果证明的是世界模型从稀疏奖励中学习长程行为链的能力不应扩张成“仅看像素就像人一样玩 Minecraft”。3.2 Ablation 与 Scaling无监督重建信号是主支柱图 6去掉各项鲁棒技巧都会降低 14 个任务的平均表现移除重建梯度比移除奖励与价值梯度伤害更大模型从 12M 扩到 400M、或提高 replay ratio性能和数据效率总体提升。来源原论文 Figure 6。消融显示KL balance 与 free bits 的平均影响最大回报归一化和 symexp two-hot 也各自在部分任务中不可替代。更关键的是学习信号实验切断 reward/value 对表征的梯度后性能只部分下降切断 reconstruction gradient 后平均表现大幅退化。DreamerV3 的状态表示主要由任务无关的观察重建塑造这为利用无标注视频预训练世界模型留下了接口。模型规模从 12M 增加到 400M 时Crafter 和 DMLab Goals 的最终性能与数据效率整体单调改善提高 replay ratio 也带来可预测收益。这说明训练配方没有只在某个固定尺寸上偶然稳定但扩展依赖更多 GPU 计算并非免费获得。4. Previous WorkDreamerV3 与规划式世界模型的差别MuZero 同样学习动力学与价值但在决策时执行搜索DreamerV3 训练时在模型中展开未来部署时直接采样 actor不做在线 lookahead。PPO 不学习显式世界模型适用面广却需要更多真实交互。Gato 从多任务专家轨迹学习统一策略而 DreamerV3 在每个环境中从自身经验和奖励学习。DreamerV1 主要面向连续控制DreamerV2 把离散潜变量和 actor–critic 想象训练扩展到 AtariDreamerV3 则把重点移到跨域鲁棒性。V3 引入或系统整合了 observation symlog、KL balance/free bits、1% unimix、百分位 return normalization、symexp two-hot、Block GRU、RMSNorm、SiLU、AGC 和 LaProp。5. Conclusion它是通用训练算法还不是一个跨任务共享大脑DreamerV3 证明了世界模型路线可以成为覆盖广泛环境的强化学习算法RSSM 学习可预测潜状态actor–critic 在想象轨迹中优化稳定化技巧消除奖励尺度、视觉复杂度和动作类型带来的大量人工调参。但“统一配置”需要准确理解学习超参数基本固定计算配置随基准变化。控制任务使用 12M 模型其余多数基准使用 200Mreplay ratio 从 32 到 1024环境并行数也不同。每个训练实例使用单块 A100不代表整项研究只用一块 GPU。多数基准有 5 个 seedMinecraft 有 10 个 seedProcGen 单个 seed 就约 16.1 GPU-days。各领域分别训练自己的世界模型。DreamerV3 不是把 150 个任务一起装进同一个模型更没有展示跨任务零样本迁移。想象只在已学分布附近可靠。actor 会受模型偏差影响短展开、真实回放起点和持续收集环境经验共同限制误差累积。公开仓库是作者提供的复现实现。README 明确说明它基于 DreamerV2 重写并非 Google 或 DeepMind 的原始内部代码。猫先生认为DreamerV3 把世界模型从“某个游戏里能做梦的智能体”推进成了“跨任务可复用的强化学习方法”。下一道门槛不是再增加几个基准而是让同一个世界模型积累跨环境知识并把互联网视频、机器人经验与任务奖励放进持续学习的共同表示中。总结想象能力要靠稳定训练才能转化为通用性DreamerV3 的工作闭环可以收在三步从真实经验学习 RSSM把观察、历史、动作、奖励和终止统一到潜状态从回放状态出发在世界模型中生成短期想象轨迹用 actor–critic 学行为用 free bits、unimix、return normalization、symlog 和 two-hot 抹平不同领域的优化尺度。Minecraft 钻石展示了长时序稀疏奖励下的上限150 多个任务展示了统一学习配方的覆盖面消融则说明真正支撑它的仍是无监督世界模型表征。DreamerV3 因此不是一句“让智能体做梦”的口号而是一套把想象训练做得足够稳定、足够可扩展的工程与算法体系。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列