DreamerV3

Deep_Reinforcement_Learning/Deep_Reinforcement_Learning/Model_Based/DreamerV3.md

2023 年,DreamerV3 带着一种君临天下的霸气登场。它的论文标题极其傲慢且自信:《Mastering Diverse Domains through World Models》。

DreamerV3 没有修改 DreamerV2 的核心架构,但它实现了深度学习工程史上的一个奇迹:它可以在完全不修改任何超参数的情况下,直接通杀 Atari 游戏、连续控制、甚至包括极其复杂的 3D 游戏《我的世界 (Minecraft)》!

它是如何抹平不同世界之间的鸿沟的?它使用了极其精妙的数学工具,其中最核心的一把钥匙叫做 Symlog(对称对数)变换


Symlog 魔法公式

f(x)=sign(x)ln(x+1)f(x) = \text{sign}(x) \ln(|x| + 1)

在 DreamerV3 中,所有的输入画面、奖励信号(Reward)甚至网络内部的数值,都会经过这个函数的洗礼。

这个公式的物理意义极其优美:

  1. 对于极小的数值(接近 0):它几乎就是线性的(f(x)xf(x) \approx x),保留了极高的灵敏度和精度。机械臂 0.1 和 0.2 的奖励差异被完美保留。
  2. 对于极其巨大的数值(比如 10000):对数函数 ln\ln 会把它狠狠地"压缩"到一个极小的范围(变成 9 左右)。
  3. 对称性sign(x)\text{sign}(x) 保证了它既能处理正奖励,也能完美压缩负惩罚(扣除 10000 分)。

通过 Symlog 和一系列精密的"自适应缩放(Adaptive Scaling)"技术,DreamerV3 让神经网络眼里的世界变得极其温和、统一。无论外面的环境给出了多么疯狂或微小的奖励,进入 AI 脑海后的信号强度永远是稳定且可控的。


总结:世界模型的完全体

从 DreamerV1 的连续探索,到 V2 确立了离散潜空间(Categorical Latent)的绝对优势,再到 V3 利用 Symlog 实现了跨领域的"无需调参大一统"。

Dreamer 家族用极其震撼的方式告诉世界:给 AI 一个能在潜空间中推演物理规律的"想象力",它就能用极其稀少的数据,征服一切复杂的环境。 这也是目前公认的最有可能通向通用人工智能(AGI)的基石方向之一。

出链

  • [[DreamerV2]]