IPPO (Independent PPO)

Deep_Reinforcement_Learning/Deep_Reinforcement_Learning/MARL/IPPO.md

IPPO (Independent PPO) = N 个独立的 PPO 算法各跑各的。

每个智能体维护自己独立的 Actor 和 Critic 网络(只看局部观测),独立运行 PPO 的 Clip 更新规则。它把队友当成环境的一部分。


为什么 IPPO 是 MARL 里出乎意料的强 Baseline?

PPO 的 Clip 机制非常稳健,对训练超参不敏感,单机表现就极其强悍。当把它直接套到多智能体上时,尽管面临非平稳性(Non-stationarity),但由于 Clip 限制了每次策略更新的幅度,IPPO 在很多合作任务上的表现竟然能逼近、甚至打平复杂的 CTDE 算法(如 MAPPO)。

学术界经常发现,在某些特定环境下,复杂的算法调参半天,最后竟然打不过原汁原味的 IPPO。

出链

  • [[PPO]]
  • [[MAPPO]]