IPPO (Independent PPO)
Deep_Reinforcement_Learning/Deep_Reinforcement_Learning/MARL/IPPO.mdIPPO (Independent PPO) = N 个独立的 PPO 算法各跑各的。
每个智能体维护自己独立的 Actor 和 Critic 网络(只看局部观测),独立运行 PPO 的 Clip 更新规则。它把队友当成环境的一部分。
为什么 IPPO 是 MARL 里出乎意料的强 Baseline?
PPO 的 Clip 机制非常稳健,对训练超参不敏感,单机表现就极其强悍。当把它直接套到多智能体上时,尽管面临非平稳性(Non-stationarity),但由于 Clip 限制了每次策略更新的幅度,IPPO 在很多合作任务上的表现竟然能逼近、甚至打平复杂的 CTDE 算法(如 MAPPO)。
学术界经常发现,在某些特定环境下,复杂的算法调参半天,最后竟然打不过原汁原味的 IPPO。
出链
- [[PPO]]
- [[MAPPO]]