OpenAI 用元学习让机器人摔跤手快速击败更强对手
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体能快速学会击败更强的非元学习智能体,并能适应自身物理故障。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体能快速学会击败更强的非元学习智能体,并能适应自身物理故障。
OpenAI 发现自对弈能让模拟 AI 在未专门设计相应环境的情况下,自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能。自对弈还能让环境难度始终与 AI 水平匹配,从而持续推动其进步。结合 Dota 2 的自对弈结果,OpenAI 表示越来越相信自对弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可了解自对弈作为训练范式的早期思路。
OpenAI 开源了 RL-Teacher,一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且表现良好,已成为 OpenAI 的默认强化学习算法。
推荐理由:OpenAI 公开了 PPO 这一强化学习算法,读者可了解它为何成为其默认训练方法。
OpenAI 开发出一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,就学到了出色的情感表征。该系统被称为无监督情感神经元。
OpenAI 认为深度学习是一门经验科学,团队基础设施的质量是进展的倍增器。如今的开源生态让任何人都能搭建出色的深度学习基础设施。
OpenAI 介绍了四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及未来可能的发展方向。
OpenAI 发布 OpenAI Gym 公测版,这是一个用于开发和对比强化学习(RL)算法的工具包。它包含一套持续扩充的环境(从模拟机器人到 Atari 游戏),以及一个用于对比和复现结果的网站。