跳到正文
原文
OpenAI News·· 2018-10-31AI 评分40

OpenAI 用基于预测的奖励做强化学习:RND 方法首次在 Montezuma's Revenge 上超越人类平均表现

AI 导读

OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境。该方法首次在 Montezuma's Revenge 上超越人类平均表现。

当前提供 AI 导读,完整正文请阅读原文。

来源:OpenAI News · openai.com