DreamerV3
Deep_Reinforcement_Learning/Deep_Reinforcement_Learning/Model_Based/DreamerV3.md2023 年,DreamerV3 带着一种君临天下的霸气登场。它的论文标题极其傲慢且自信:《Mastering Diverse Domains through World Models》。
DreamerV3 没有修改 DreamerV2 的核心架构,但它实现了深度学习工程史上的一个奇迹:它可以在完全不修改任何超参数的情况下,直接通杀 Atari 游戏、连续控制、甚至包括极其复杂的 3D 游戏《我的世界 (Minecraft)》!
它是如何抹平不同世界之间的鸿沟的?它使用了极其精妙的数学工具,其中最核心的一把钥匙叫做 Symlog(对称对数)变换。
Symlog 魔法公式
在 DreamerV3 中,所有的输入画面、奖励信号(Reward)甚至网络内部的数值,都会经过这个函数的洗礼。
这个公式的物理意义极其优美:
- 对于极小的数值(接近 0):它几乎就是线性的(),保留了极高的灵敏度和精度。机械臂 0.1 和 0.2 的奖励差异被完美保留。
- 对于极其巨大的数值(比如 10000):对数函数 会把它狠狠地"压缩"到一个极小的范围(变成 9 左右)。
- 对称性: 保证了它既能处理正奖励,也能完美压缩负惩罚(扣除 10000 分)。
通过 Symlog 和一系列精密的"自适应缩放(Adaptive Scaling)"技术,DreamerV3 让神经网络眼里的世界变得极其温和、统一。无论外面的环境给出了多么疯狂或微小的奖励,进入 AI 脑海后的信号强度永远是稳定且可控的。
总结:世界模型的完全体
从 DreamerV1 的连续探索,到 V2 确立了离散潜空间(Categorical Latent)的绝对优势,再到 V3 利用 Symlog 实现了跨领域的"无需调参大一统"。
Dreamer 家族用极其震撼的方式告诉世界:给 AI 一个能在潜空间中推演物理规律的"想象力",它就能用极其稀少的数据,征服一切复杂的环境。 这也是目前公认的最有可能通向通用人工智能(AGI)的基石方向之一。
出链
- [[DreamerV2]]