OpenAI·· 2018-10-31精选AI 评分70
OpenAI 提出基于预测奖励的强化学习方法 RND
Reinforcement learning with prediction-based rewards
AI 导读
OpenAI 研发了随机网络蒸馏(Random Network Distillation,RND),这是一种基于预测奖励驱动强化学习智能体通过好奇心探索环境的方法。该方法在经典强化学习测试游戏 Montezuma's Revenge 上的表现首次超过了人类平均水平。
推荐理由
原文提出了基于好奇心驱动强化学习智能体探索的方法,为解决稀疏奖励环境下的探索难题提供了具体思路。
来源:OpenAI · openai.com