跳到正文
原文
OpenAI·· 2017-07-20精选AI 评分74

OpenAI 发布强化学习算法 PPO

Proximal Policy Optimization

AI 导读

OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。

推荐理由

OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。

来源:OpenAI · openai.com