OpenAI News·· 2018-07-04精选AI 评分
OpenAI 从单次演示中学习 Montezuma's Revenge
Learning Montezuma’s Revenge from a single demonstration
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
来源:OpenAI News · openai.com