OpenAI Five 在 The International 2018 两局不敌顶尖 Dota 2 选手
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负。在两局比赛的前 20 至 35 分钟内,它仍保持着较大的获胜机会。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负。在两局比赛的前 20 至 35 分钟内,它仍保持着较大的获胜机会。
OpenAI Five 在与 Blitz、Cap、Fogged、Merlini、MoonMeander 组成的 99.95 百分位 Dota 玩家队伍的三局两胜比赛中获胜,其中四人曾打过职业 Dota。比赛在直播观众面前进行,同时在线观看人数达 10 万。
OpenAI 训练出一只类人机械手,能以"前所未有的灵巧度"操控实体物体。该成果展示了机器人手部操作能力的新水平。
OpenAI Scholars 2018 首批学员已开始学习,这群经验丰富的软件开发者正转型为机器学习从业者。该项目进展可通过官方渠道持续关注。
OpenAI 宣布 OpenAI Five Benchmark 比赛已经结束。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时可生成逼真的高分辨率图像并支持高效采样。该模型还能发现可用于操控数据属性的特征,相关代码与在线可视化工具已开放。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已开始在与 Dota 2 业余人类队伍的对战中取胜。
推荐理由:OpenAI 披露由五个神经网络组成的 OpenAI Five 已能击败业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 首届 Retro Contest 已完成,该竞赛探索能够从既往经验中泛化的算法。竞赛结果现已公布。
OpenAI 用可扩展、与任务无关的系统在一组多样语言任务上取得 state-of-the-art 结果,并公开该系统。其方法结合了 Transformer 与无监督预训练两个已有思路,作者认为这为监督学习方法搭配无监督预训练的有效性提供了有说服力的例证,并希望推动在更大、更多样数据集上继续研究这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 开放 OpenAI Fellows 2018 秋季班申请,该项目提供为期 6 个月、带薪酬的 AI 研究学徒岗位。
OpenAI 发布强化学习游戏平台 Gym Retro 完整版,公开游戏数量从约 70 款 Atari 和 30 款 Sega 游戏扩展至超过 1000 款,覆盖多种模拟器后端。OpenAI 同时发布了用于向该平台添加新游戏的工具。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍计算则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 2012 年以来的训练算力数据给出 3.4 个月翻倍的经验规律,可与摩尔定律对照理解 AI 进展节奏。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断谁获胜。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
OpenAI 发起 Retro Contest 迁移学习竞赛,用于衡量强化学习算法从既往经验中泛化的能力。
OpenAI 于 3 月 3 日举办了首届黑客松,共有 100 名人工智能社区成员参与。
OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、对任务执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需黑盒访问 SGD 或 Adam 等优化器,计算效率与性能相当。
OpenAI 推出 OpenAI Scholars 计划,为来自 underrepresented 群体的个人提供 6–10 份津贴和导师指导,支持其全职学习深度学习 3 个月,并开源一个项目。
OpenAI 发布八个模拟机器人环境,以及 Hindsight Experience Replay 的 Baselines 实现,均出自其过去一年的研究。这些环境已用于训练可迁移到实体机器人的模型,OpenAI 同时发布了一组机器人研究议题。
OpenAI 将于 3 月 3 日(周六)在旧金山 Mission District 办公室举办演讲与 hackathon 活动。
OpenAI 宣布迎来新的捐赠者加入其支持者行列。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security、Electronic Frontier Foundation 等机构合著论文,预测恶意行为者可能如何滥用 AI 技术,并提出预防与缓解威胁的潜在方法。
OpenAI 设计了一种让 AI 相互教学的方法,所选取的示例同样能被人类理解。该方法自动挑选最具信息量的示例来教授某个概念,例如用最能描述"狗"这一概念的图像,实验证明它对 AI 和人类的教学都有效。
OpenAI 构建了一套实体消歧系统,通过神经网络判断一个词是否属于约 100 个自动发现的“类型”(非互斥类别),从而自动确定该词指代的是哪个对象。
OpenAI 发布 Requests for Research 2.0,公开了 7 个在其研究过程中出现的未解问题。该批问题面向研究社区征集解法,延续了此前 Requests for Research 的形式。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。团队已用这些内核在文本情感分析和文本、图像生成建模上取得 SOTA 结果。
OpenAI 开发出一种分层强化学习算法,能学习可解决多种任务的高层动作,从而快速求解需要数千个 timestep 的任务。该算法应用于一组导航问题时,自动发现了向不同方向行走和爬行的高层动作集合,使智能体能够快速掌握新的导航任务。
OpenAI 的机器人技术让完全在仿真中训练、部署到实体机器人上的控制器,能在执行简单任务时对环境中未预料的变化做出反应,即从开环系统转为闭环系统。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体能快速学会击败更强的非元学习智能体,并能适应自身物理故障。
OpenAI 发现自对弈能让模拟 AI 在未专门设计相应环境的情况下,自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能。自对弈还能让环境难度始终与 AI 水平匹配,从而持续推动其进步。结合 Dota 2 的自对弈结果,OpenAI 表示越来越相信自对弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可了解自对弈作为训练范式的早期思路。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习这一事实,从而在迭代囚徒困境中发现互惠合作式的自利策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI Baselines 新增 ACKTR 和 A2C 两个强化学习算法实现。A2C 是 A3C 的同步确定性变体,性能与之相当;ACKTR 比 TRPO 和 A2C 更节省样本,每次更新仅比 A2C 略多计算量。
OpenAI 发文说明其 Dota 2 结果:在算力充足时,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统中可用数据会随智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在充足算力下能把系统从远低于人类提升到超人水平。
OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。
OpenAI 开源了 RL-Teacher,一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且表现良好,已成为 OpenAI 的默认强化学习算法。
推荐理由:OpenAI 公开了 PPO 这一强化学习算法,读者可了解它为何成为其默认训练方法。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定骗过神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
OpenAI 开源了一个基于 MuJoCo 引擎的高性能 Python 机器人仿真库,该库源自其过去一年的机器人研究。