DREAM TO CONTROL: LEARNING BEHAVIORSBY LATENT IMAGINATION(论文精读)
前言:
读完PlaNet之后,继续看Dreamer系列的文章,这是一个阅读笔记文章,方便随时学习和记录。
摘要:
学习到的世界模型会总结智能体的经验,以促进复杂行为的学习。虽然通过深度学习从高维感官输入中学习世界模型正变得可行,但从中推导行为的方法有很多。我们提出了Dreamer,这是一种强化学习智能体,它纯粹通过潜在想象来解决基于图像的长时任务。我们通过在学习到的世界模型的紧凑状态空间中,将学习到的状态值的解析梯度反向传播通过想象的轨迹,从而高效地学习行为。在20项具有挑战性的视觉控制任务上,Dreamer在数据效率、计算时间和最终性能方面都超越了现有方法。
思考:它不依赖于在线规划(如PlaNet),而是通过一个新颖的、基于梯度的学习方法,完全在自己学到的世界模型的“梦境”中,高效地学习一个能够看得更远的策略。
1引言
智能体能够在复杂环境中实现目标,即使它们从未两次遇到完全相同的情况。这种能力需要从过去的经验中构建世界表征,以便能够泛化到新的情境中。世界模型提供了一种明确的方式,将智能体关于世界的知识表示在一个参数化模型中,该模型能够对未来做出预测。
当感官输入是高维图像时, latent dynamics models可以对观测值进行抽象,以便在紧凑的状态空间中进行前向预测(Watter等,2015;Oh等,2017;Gregor等,2019)。与在图像空间中进行预测相比, latent states 的内存占用较小,能够并行模拟数千条轨迹。随着深度学习和 latent variable models 的发展,学习有效的 latent dynamics models正变得可行(Krishnan等,2015;Karl等,2016;Doerr等,2018;Buesing等,2018)。
行为可以通过多种方式从动力学模型中推导出来。通常,想象奖励通过参数化策略(Sutton,1991; Ha and Schmidhuber,2018; Zhang等,2019)或在线规划(Chua等,2018; Hafner等,2018)来最大化。然而,仅在固定想象范围内考虑奖励会导致短视行为(Wang等,2019)。此外,先前的研究通常采用无导数优化以提高对模型误差的鲁棒性(Ebert等,2017; Chua等,2018; Parmas等,2019),而非利用神经网络动力学提供的解析梯度(Henaff等,2019; Srinivas等,2018)。
我们提出了Dreamer,这是一种仅通过潜在想象就能从图像中学习长期行为的智能体。一种新颖的演员-评论家算法在有效利用神经网络动态的同时,能够考虑到想象范围之外的奖励。为此,我们在学习到的潜在空间中预测状态值和动作,如图1所示。这些值针对想象奖励优化贝尔曼一致性,而策略则通过动态反向传播其解析梯度来最大化这些值。
与在线学习或通过经验回放学习的 Actor-Critic算法(Lillicrap等,2015;Mnih等,2016;Schulman等,2017;Haarnoja等,2018;Lee等,2019)相比,世界模型能够对过去的经验进行插值,并为高效的策略优化提供多步回报的解析梯度。
本文的主要贡献总结如下:
通过潜在想象学习长时程行为 如果基于模型的智能体使用有限的想象视野,它们可能会目光短浅。我们通过预测动作和状态值来解决这一局限性。在潜在空间中纯粹通过想象进行训练,使我们能够通过潜在动力学反向传播解析值梯度,从而有效地学习策略。
视觉控制的实证性能我们将Dreamer与现有的表征学习方法相结合,并在DeepMind Control Suite上使用图像输入进行评估,如图2所示。在所有任务中使用相同的超参数,Dreamer在数据效率、计算时间和最终性能方面超过了以往的基于模型和无模型智能体。
思考:
问题1:短视行为 (shortsighted behaviors):以往的方法(包括PlaNet)通常只考虑一个固定的、有限的想象长度。只最大化这个长度内的奖励,会导致智能体行为短视 。
问题2:优化效率低: 为了应对模型误差,先前的工作(同样包括PlaNet)通常采用无导数优化 (derivative-free optimization)方法(如CEM规划算法)来寻找动作。这种方法虽然鲁棒,但没有充分利用神经网络动态模型本身提供的、可用于高效学习的解析梯度 (analytic gradients)
Dreamer提出了一种新颖的Actor-Critic算法来解决上述问题 。解决“短视”问题: 它不仅学习一个动作模型 (Action Model / Actor),还学习一个价值模型 (Value Model / Critic)。这个价值模型的作用是预测在想象长度之外的未来奖励总和,从而让智能体变得更有远见 。解决“效率”问题: 它通过将价值模型的预测值,沿着在世界模型中想象出的轨迹进行反向传播,来计算解析梯度,并用这些梯度来高效地更新动作模型。
2 基于世界模型的控制
强化学习我们将视觉控制表述为一个部分可观测马尔可夫决策过程(POMDP),其中时间步t ∈ [1; T]为离散的,连续向量值动作at ∼ p(at | o≤t, a<t)由智能体生成,高维观测和标量奖励ot, rt ∼ p(ot, rt | o<t, a<t)由未知环境生成。目标是开发一个智能体,使其最大化预期奖励总和Eₚ。图2展示了我们的部分任务。
智能体组件具有想象学习能力的智能体的经典组件包括动态学习、行为学习和环境交互(Sutton,1991)。在Dreamer中,行为学习是通过在世界模型的紧凑 latent空间中预测假设轨迹来实现的。如图3所示及算法1详述,Dreamer在智能体的整个生命周期中执行以下操作,这些操作可以交替进行或并行进行:
从过去经验的数据集中学习潜在动态模型,以根据动作和过去的观测预测未来奖励。Dreamer可以整合任何世界模型的学习目标。我们在第4节中回顾了现有的潜在动态学习方法。
如第3节所述,从预测的潜在轨迹中学习动作模型和价值模型。价值模型针对想象奖励优化贝尔曼一致性,动作模型通过将价值估计的梯度反向传播通过神经网络动力学进行更新。
在现实世界中执行学习到的动作模型,以收集新经验来扩充数据集。
潜在动力学 Dreamer 使用一种由三个组件构成的潜在动力学模型。表征模型对观测和动作进行编码,以创建具有马尔可夫转移的连续向量值模型状态 \(s_t\)(Watter等,2015;Zhang等,2019;Hafner等,2018)。转移模型在不看到稍后会导致这些状态的相应观测的情况下预测未来的模型状态。奖励模型根据模型状态预测奖励。

我们使用p表示在真实环境中生成样本的分布,q表示能够进行潜在想象的近似分布。具体来说,过渡模型使我们能够在紧凑的潜在空间中进行超前预测,而无需观察或想象相应的图像。这导致内存占用较低,并且可以并行快速预测数千条想象轨迹。
该模型模拟了非线性卡尔曼滤波器(Kalman,1960)、 latent state space model或具有实值状态的 HMM。然而,它以行动为条件并预测奖励,使智能体能够想象潜在行动序列的结果,而无需在环境中执行这些序列。

思考:与PlaNet一样,文章将视觉控制问题设定为一个部分可观测马尔可夫决策过程 (POMDP) 。
三个核心组件,动态学习、行为学习和环境交互,Dreamer的整个生命周期都在并行或交错地执行这三个操作:
- 学习潜在动态模型 (Learning the latent dynamics model):从过去经验的数据集中学习世界模型,用以预测未来的奖励 。
- 在想象中学习行为 (Learning action and value models):在预测出的潜在轨迹中学习动作模型和价值模型 。价值模型优化贝尔曼一致性,而动作模型通过反向传播价值梯度的来更新
- 在环境中执行并收集经验 (Executing the learned action model):在真实世界中执行学到的动作模型,为数据集收集新的经验 。
潜在动态模型 (Latent dynamics): Dreamer使用的潜在动态模型(世界模型)由三个部分组成:
-
表征模型 (Representation model): 将观测和动作编码为连续的、马尔可夫式的模型状态
s_t转移模型 (Transition model): 在不看未来真实观测的情况下,预测未来的模型状态 。这使得在紧凑的潜在空间中进行前向预测成为可能 。
-
奖励模型 (Reward model): 根据模型状态预测奖励
3通过潜在想象学习行为
Dreamer通过高效利用神经网络潜在动态,在学习到的世界模型的紧凑潜在空间中学习长时程行为。为此,我们使用重参数化方法,通过动作、状态、奖励和价值的神经网络预测来传播多步回报的随机梯度。本节介绍了我们论文的主要贡献。
想象环境潜在动态定义了一个马尔可夫决策过程(MDP;Sutton,1991),该过程是完全可观测的,因为紧凑模型状态\(s_t\)具有马尔可夫性。我们用\(\tau\)作为时间索引来表示想象量。想象轨迹始于从智能体过去经验中提取的观测序列的真实模型状态\(s_t\)。它们遵循转移模型\(s_\tau \sim q(s_\tau | s_{\tau-1}, a_{\tau-1})\)、奖励模型\(r_\tau \sim q(r_\tau | s_\tau)\)和策略\(a_\tau \sim q(a_\tau | s_\tau)\)的预测。目标是相对于策略最大化期望想象奖励\(\mathbb{E}_q \left( \sum_{\tau=t}^\infty \gamma^{\tau-t} r_\tau \right)\)。


动作与价值模型考虑具有有限 horizon H 的想象轨迹。Dreamer采用 actor critic方法来学习能够考虑 horizon之外奖励的行为。为此,我们在世界模型的潜在空间中学习动作模型和价值模型。动作模型实现策略,旨在预测能够解决想象环境的动作。价值模型从每个状态 sτ估计动作模型所获得的期望想象奖励。

我们分别使用参数为φ和ψ的密集神经网络作为动作模型和价值模型。动作模型输出经过tanh变换的高斯分布(Haarnoja等,2018),其充分统计量由神经网络预测。这允许进行重参数化采样(Kingma和Welling,2013;Rezende等,2014),该采样将采样动作视为确定性地依赖于神经网络输出,从而使我们能够通过采样操作反向传播解析梯度。
价值估计为了学习动作模型和价值模型,我们需要估计想象轨迹{sτ, aτ, rτ}t+H τ=t的状态价值。这些轨迹从从智能体经验数据集中抽取的序列批次的模型状态st分叉出来,并使用从动作模型采样的动作在想象 horizon H内进行前向预测。状态价值可以通过多种方法进行估计,这些方法在偏差和方差之间进行权衡(Sutton和Barto,2018)。

其中期望是在想象轨迹下估计的。VR只是对 τ直至视界的奖励进行求和,并忽略视界之外的奖励。这使得无需价值模型即可学习动作模型,我们在实验中对此进行了对比消融实验。\( V_k^N \) 使用学习到的价值模型来估计 k步之外的奖励。Dreamer 使用 \( V_\lambda \),即不同 k 值估计的指数加权平均,以平衡偏差和方差。图4表明,在想象中学习价值模型使 Dreamer能够解决长视界任务,同时对视界具有鲁棒性。所有任务的实验细节和结果在第6节中描述。

学习目标为了更新动作模型和价值模型,我们首先计算想象轨迹上所有状态$s_{\tau}$的价值估计$V^{\lambda}(s_{\tau})$。动作模型$q_{\phi}(a_{\tau}|s_{\tau})$的目标是预测能够产生具有高价值估计的状态轨迹的动作。反过来,价值模型$v_{\psi}(s_{\tau})$的目标是对价值估计进行回归。

价值模型经过更新以回归目标值,我们像往常一样在目标值附近停止梯度(Sutton和Barto,2018)。动作模型通过学习到的动态特性使用解析梯度来最大化价值估计。为理解这一点,我们注意到价值估计依赖于奖励和价值预测,而奖励和价值预测又依赖于想象状态,想象状态反过来又依赖于想象动作。由于所有步骤都通过神经网络实现,我们通过随机反向传播解析计算∇φEqθ,qφt+H τ=t Vλ(sτ)(Kingma和Welling,2013;Rezende等,2014)。对于连续动作和潜在状态,我们使用重参数化;对于离散动作,我们使用直通梯度(Bengio等,2013)。在学习行为时,世界模型保持固定。在具有提前终止的任务中,世界模型还从每个潜在状态预测折扣因子,通过预测折扣因子的累积乘积来对公式7和公式8中的时间步进行加权,因此根据想象轨迹结束的可能性对各项进行加权降低。
价值模型经过更新以回归目标值,我们像往常一样在目标值附近停止梯度(Sutton和Barto,2018)。动作模型通过学习到的动态特性使用解析梯度来最大化价值估计。为理解这一点,我们注意到价值估计依赖于奖励和价值预测,而奖励和价值预测又依赖于想象状态,想象状态反过来又依赖于想象动作。由于所有步骤都通过神经网络实现,我们通过随机反向传播解析计算∇φEqθ,qφt+H τ=t Vλ(sτ)(Kingma和Welling,2013;Rezende等,2014)。对于连续动作和潜在状态,我们使用重参数化;对于离散动作,我们使用直通梯度(Bengio等,2013)。在学习行为时,世界模型保持固定。在具有提前终止的任务中,世界模型还从每个潜在状态预测折扣因子,通过预测折扣因子的累积乘积来对公式7和公式8中的时间步进行加权,因此根据想象轨迹结束的可能性对各项进行加权降低。
思考:
-
想象环境 (Imagination environment):
-
学习到的潜在动态模型本身定义了一个完全可观测的马尔可夫决策过程 (MDP) 。
-
智能体从其过去的真实经验数据集中抽取真实的状态
s_t作为“想象”的起点 。从这个起点开始,完全依靠转移模型、奖励模型和一个正在学习的**策略(动作模型)**来生成一条条未来的轨迹 。 -
在想象环境中的学习目标,就是最大化预期的想象奖励总和 。
-
-
动作模型和价值模型 (Action and value models):
- 为了在有限的想象长度(horizon H)内学到有远见的行为,Dreamer采用了一种Actor-Critic方法,在潜在空间中学习了两个模型 :
动作模型 (Action model): 这就是策略 (policy),旨在预测出能够解决想象环境的动作 。价值模型 (Value model): 它的作用是估计从任意状态
s_τ出发,遵循动作模型将会获得的未来奖励总和 。
- 为了在有限的想象长度(horizon H)内学到有远见的行为,Dreamer采用了一种Actor-Critic方法,在潜在空间中学习了两个模型 :
-
价值估计 (Value estimation):
-
为了解决有限想象长度带来的“短视”问题,Dreamer不只是简单地累加想象出的
H步奖励 。它采用了一种名为λ-return 的方法,巧妙地将多步的真实想象奖励和在想象终点由价值模型预测的未来价值进行指数加权平均 。这使得对当前状态的价值评估,能够考虑到远超想象长度H之外的未来,从而让智能体变得更有远见 。
-
-
学习目标与梯度反向传播:
-
价值模型的目标: 其学习目标是去拟合上面计算出的、更有远见的λ-return价值估计
V_λ。动作模型的目标: 其学习目标是最大化从想象轨迹的每个状态出发的价值估计 。关键创新: 由于整个想象过程(转移模型、奖励模型、价值模型、动作模型)都是由神经网络实现的,因此可以通过想象出的完整轨迹,将价值的梯度解析地、端到端地反向传播回来,直接更新动作模型的参数 。
-
-
与planet的区别,决策方式,远见能力,优化方案都不同
-
决策方式,Dreamer学习一个策略网络,planet是在线规划
-
远见能力,Dreamer用价值模型估计H步之外的奖励,planet是只考虑H步之内的奖励
-
优化方案,Dreamer通过世界模型反向传播,planet没有导数优化
4学习 latent动力学
在想象中学习行为需要一个泛化能力良好的世界模型。我们专注于在紧凑的 latent空间中进行前向预测的 latent动力学模型,这有助于进行长期预测,并允许智能体并行想象数千条轨迹。已有研究提出了多种用于学习控制表示的目标函数(Watter等,2015;Jaderberg等,2016;Oord等,2018;Eslami等,2018)。我们回顾了三种用于 Dreamer 的表示学习方法:奖励预测、图像重建和对比估计。
奖励预测潜在想象需要表征模型$p(s_t | s_{t-1}, a_{t-1}, o_t)$、转移模型$q(s_t | s_{t-1}, a_{t-1}, )$和奖励模型$q(r_t | s_t)$,如第2节所述。原则上,这可以通过学习根据动作和过去的观测预测未来奖励来实现(Oh等,2017;Gelada等,2019;Schrittwieser等,2019)。利用大型多样化数据集,此类表征应足以解决控制任务。然而,在有限数据集下,尤其是当奖励稀疏时,学习与奖励相关的观测可能会改进世界模型(Jaderberg等,2016;Gregor等,2019)。

重建我们首先描述PlaNet(Hafner等,2018)所使用的世界模型,该模型通过重建图像来学习潜在动态,如图3a所示。世界模型由以下组件构成,其中观测模型仅用于提供学习信号,
这些组件被联合优化以增加变分下界(ELBO;Jordan等,1999)或更一般的变分信息瓶颈(VIB;Tishby等,2000;Alemi等,2016)。如附录B中所推导,该界包括观测值和奖励的重建项以及KL正则化项。期望是在数据集和表示模型下进行的。

我们将转移模型实现为循环状态空间模型(RSSM;Hafner等,2018),表示模型通过将RSSM与应用于图像观测的卷积神经网络(CNN;LeCun等,1989)相结合来实现,观测模型为转置CNN,奖励模型为全连接网络。组合参数向量θ通过随机反向传播(Kingma和Welling,2013;Rezende等,2014)进行更新。图5展示了该模型的视频预测结果。有关模型细节,我们参考附录A和Hafner等(2018)。
对比估计预测像素可能需要较高的模型容量。我们还可以通过从图像中预测状态来促进模型状态和观测值之间的互信息(Guo等,2018)。这用状态模型取代了观测模型,
![]()
虽然重建目标利用了观测边缘分布为常数这一事实,但我们现在面临的是状态边缘分布。如附录B所示,这可以通过噪声对比估计(NCE;Gutmann和Hyvärinen,2010;Oord等,2018)对当前序列批次的观测值\(o'\)求状态模型的平均值来估计。直观地说,\(q(s_t | o_t)\)使得状态可从当前图像预测,而\(\ln \sum o' q(s_t | o')\)则保持状态的多样性以防止坍缩。

我们将状态模型实现为CNN,并再次使用随机反向传播针对组合参数向量θ优化边界。虽然避免了像素预测,但该边界能够有效提取的信息量是有限的(McAllester和Statos,2018)。我们在实验中通过图8对奖励目标、重建目标和对比目标进行了实证比较。

思考:Dreamer专注于学习一个能在紧凑潜在空间中进行前向预测的潜在动态模型,这使得智能体能够并行地想象数千条轨迹,
-
奖励预测 (Reward prediction):
-
原理: 理论上,一个好的世界模型只需要能够准确预测未来的奖励就足够了。
-
问题: 在数据集有限,尤其是奖励稀疏的情况下,仅仅依赖奖励信号很难学习到有用的世界表征。
-
-
图像重构 (Image reconstruction):
-
原理: 这是PlaNet所使用的方法。它通过一个观测模型来学习从潜在状态重构出原始的图像。这为世界模型的学习提供了非常丰富和密集的监督信号。
-
与您已知知识的联系: 训练目标是最大化变分边界(ELBO),这包括了重构损失和KL散度两部分,这与您在PlaNet论文中读到的是一致的。
-
实现: 该方法将RSSM与一个卷积神经网络(CNN)编码器和一个转置卷积神经网络(transposed CNN)解码器(用于重构)结合起来。
-
-
对比估计 (Contrastive estimation):
-
原理: 预测像素(图像重构)可能需要很高的模型容量。作为替代方案,可以通过一个状态模型来从图像中预测其对应的状态,并通过**噪声对比估计(NCE)**来鼓励模型状态和观测之间的互信息。
-
直观理解: 这个目标函数使状态对于当前图像是可预测的,同时通过与其他图像进行对比,保持了状态的多样性以防止模型坍塌。
-
实验表明,利用图像重构来提供丰富的学习信号,是目前最为有效和鲁棒的方式。
5相关工作
先前的研究通过无导数策略学习或在线规划来学习视觉控制的潜在动态,用多步预测增强无模型智能体,或者使用Q值或多步奖励的解析梯度,这些方法通常适用于低维任务。相比之下,Dreamer使用解析梯度,纯粹通过潜在想象来高效学习视觉控制的长 horizon行为。
基于潜在动力学的控制方法E2C(Watter等,2015)和RCE(Banijamali等,2017)对图像进行嵌入,以在紧凑空间中进行前向预测,从而解决简单任务。World Models(Ha和Schmidhuber,2018)通过两阶段过程学习潜在动力学,以在想象中优化线性控制器。PlaNet(Hafner等,2018)对潜在动力学进行联合学习,并通过潜在在线规划解决视觉运动任务。SOLAR(Zhang等,2019)通过潜在空间中的引导策略搜索解决机器人任务。I2A(Weber等,2017)将想象轨迹传递给无模型策略,而Lee等(2019)和Gregor等(2019)则学习信念表示以加速无模型智能体。
想象的多步回报VPN(Oh等,2017)、MVE(Feinberg等,2018)和STEVE(Buckman等,2018)从回放缓冲区中学习多步Q学习的动态特性。AlphaGo(Silver等,2017)将动作和状态值的预测与规划相结合,假设可以获取真实的动态特性。同样假设可以获取动态特性,POLO(Lowrey等,2018)通过学习价值集成来进行探索规划。MuZero(Schrittwieser等,2019)学习特定任务的奖励和价值模型以解决具有挑战性的任务,但需要大量的经验。PETS(Chua等,2018)、VisualMPC(Ebert等,2017)和PlaNet(Hafner等,2018)使用无导数优化进行在线规划。POPLIN(Wang和Ba,2019)通过自我模仿改进了在线规划。Piergiovanni等(2018)利用潜在
解析值梯度DPG(Silver等,2014)、DDPG(Lillicrap等,2015)和SAC(Haarnoja等,2018)利用学习到的即时动作值的梯度,通过经验回放来学习策略。SVG(Heess等,2015)通过一步模型预测的解析值梯度,降低无模型在线策略算法的方差。Byravan等(2019)的并行工作将潜在想象与确定性模型用于导航和操作任务。ME-TRPO(Kurutach等,2018)通过本体感受输入的预测奖励梯度,加速原本无模型的智能体。DistGBP(Henaff等,2017;2019)在简单任务中使用模型梯度进行在线规划。

6实验
我们在各种控制任务上对Dreamer进行了实验评估。我们设计这些实验是为了将Dreamer与文献中当前最佳方法进行比较,并评估其解决长视野、连续动作、离散动作和提前终止任务的能力。我们进一步比较了世界模型学习目标的正交选择。所有实验的源代码和Dreamer的视频可在https://danijar.com/dreamer获取。
控制任务我们在DeepMind控制套件(Tassa等,2018)的20个视觉控制任务上对Dreamer进行了评估,如图2所示。这些任务带来了各种挑战,包括稀疏奖励、接触动力学和三维场景。我们选择了Tassa等(2018)报告的从图像输入中获得非零性能的任务。智能体观测值是尺寸为64×64×3的图像,动作维度范围为1到12,奖励范围为0到1,每个回合持续1000步,初始状态随机。我们在所有任务中使用固定的动作重复次数R=2。我们进一步评估了Dreamer在离散动作和提前终止方面的适用性,所用的Atari游戏(Bellemare等,2013)和DeepMind Lab关卡(Beattie等,2016)子集详见附录C。
实现我们的实现使用了TensorFlow Probability(Dillon等,2017)。我们为每次训练运行使用单个Nvidia V100 GPU和10个CPU核心。在控制套件上,我们的Dreamer实现每10⁶个环境步骤的训练时间约为3小时,相比之下,使用PlaNet进行在线规划需要11小时,而D4PG达到类似性能则需要24小时。我们在所有连续任务中使用相同的超参数,在所有离散任务中也使用相同的超参数,详情见附录A。除非另有说明,否则世界模型是通过重构来学习的。
基准方法 在连续任务上报告的最高性能由D4PG(Barth-Maron等,2018)实现,它是DDPG(Lillicrap等,2015)的改进变体,采用分布式收集、分布式Q学习、多步回报和优先回放。我们纳入了Tassa等(2018)报告的基于像素输入的D4PG以及基于状态输入的A3C(Mnih等,2016)的分数。PlaNet(Hafner等,2018)学习与Dreamer相同的世界模型,并通过无动作模型的在线规划来选择动作,在数据效率方面显著优于D4PG和A3C。为统一实验设置,我们使用R=2重新运行了PlaNet。对于Atari,我们展示了Castro等(2018)报告的SimPLe(Kaiser等,2019)、DQN(Mnih等,2015)和Rainbow(Hessel等,2018)的最终性能;对于DeepMind Lab,则以IMPALA(Espeholt等,2018)的性能作为参考。
性能评估为了评估Dreamer的性能,我们将其与最先进的强化学习智能体进行了比较。结果总结在图6中。在5×10⁶环境步后,Dreamer在各项任务中的平均得分为823,超过了强无模型D4PG智能体的性能,后者在10⁸环境步内的平均得分为786。同时,Dreamer继承了PlaNet的数据效率,证实了学习到的世界模型有助于从少量经验中进行泛化。Dreamer的实证成功表明,通过世界模型进行潜在想象来学习行为可以优于基于经验回放的顶级方法。
长时程为了研究其学习长时程行为的能力,我们将Dreamer与在不同时程长度下从世界模型中推导行为的替代方法进行了比较。为此,我们学习了一个无需价值模型即可最大化想象奖励的动作模型,并与使用PlaNet的在线规划进行了对比。图4展示了不同想象时程下的最终性能,证实了价值模型使Dreamer对时程更加稳健,即使在短时程下也表现良好。附录D中展示了所有19个任务在时程为20时的性能曲线,其中Dreamer在20个任务中的16个任务上优于替代方法,有4个任务持平。
表示学习 Dreamer可与任何可微动力学模型结合使用,该模型能根据动作和过去的观测预测未来奖励。由于表示学习目标与我们的算法相互独立,我们比较了第4节中描述的三种常见选择:像素重建、对比估计和纯奖励预测。图8显示了不同表示学习方法在任务性能上的明显差异,其中像素重建在大多数任务上的表现优于对比估计。这表明,表示学习的未来改进可能会转化为 Dreamer更高的任务性能。在我们的实验中,仅靠奖励预测是不够的。更多消融实验包含在论文的附录中。
7结论
我们提出了Dreamer,这是一种纯粹通过潜在想象来学习长期行为的智能体。为此,我们提出了一种演员-评论家方法,该方法通过学习到的潜在动力学反向传播多步值的解析梯度来优化参数化策略。在各种具有图像输入的挑战性连续控制任务上,Dreamer在数据效率、计算时间和最终性能方面均优于以往方法。我们进一步表明,Dreamer适用于具有离散动作和早期回合终止的任务。未来关于表示学习的研究可能会将潜在想象扩展到具有更高视觉复杂性的环境中。
总结:Dreamer成功地将强大的世界模型(RSSM)与高效的、基于梯度的Actor-Critic策略学习框架相结合。通过在想象中学习价值和策略,它解决了先前方法的短视和效率问题,为基于模型的强化学习设定了新的技术标杆,并证明了“做梦学习”是一条通往通用决策智能的可行路径
更多推荐



所有评论(0)