OpenAI 提出能量模型(EBM)的隐式生成与泛化方法
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 公布 2019 届 OpenAI Scholars 名单,8 位学者从 550 名申请者中入选。他们的专业背景涵盖文学、哲学、细胞生物学、统计学、经济学、量子物理与商业创新。
OpenAI 宣布成立 OpenAI LP,一家采用利润上限(capped-profit)结构的新公司,以便快速增加在算力和人才上的投入,同时通过制衡机制确保其使命得以实现。
推荐理由:OpenAI 官方说明其营利实体结构与利润上限安排,是理解该公司治理与使命约束的原始材料。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程将有助于识别弱点和调查失败原因。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持在持久、开放式的任务中容纳数量可变的大量智能体,多智能体与多物种的引入带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 于 2 月 2 日举办首届 Spinning Up Workshop,这是其新教育计划的一部分。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与下有效。对齐先进 AI 系统与人类价值观,需解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职从事该方向研究,以推动机器学习与社会科学的合作。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯的段落文本,在多项语言建模基准上达到当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 披露了无监督语言模型在多项语言任务上的表现,可了解早期大模型的能力边界。
OpenAI 首期 Fellows 项目结业,每位学员在 6 个月学徒期内从机器学习初学者成长为 OpenAI 的核心贡献者。该项目公布了学员的结业项目。
OpenAI 发现梯度噪声尺度这一简单统计指标可预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的泛化能力,并已帮助厘清强化学习领域一个长期存在的难题。CoinRun 在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但对当前最先进算法仍构成值得挑战的泛化测试。
OpenAI 发布 Spinning Up in Deep RL,一套面向深度强化学习的教育资料,目标是让任何人都能学习成为该领域的熟练实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 开发了一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的概念,如 near、above、between、closest 和 furthest。该模型还展现出跨域迁移能力:在 2D 粒子环境中学习的概念可用于解决 3D 物理机器人的任务。
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境。该方法首次在 Montezuma's Revenge 上超越人类平均表现。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把复杂任务拆解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它有望成为可扩展的 AI 安全方案。
OpenAI 开放第二届 OpenAI Scholars 项目申请,面向 underrepresented 群体提供 6–10 个津贴与导师指导名额,全职学习深度学习 3 个月并开源一个项目。
OpenAI 开始接受 2019 年 Fellows 冬季项目和 Interns 夏季项目的申请。
OpenAI 首批 Scholars 项目学员已完成该计划,并提交了各自的最终项目。该项目是 OpenAI 于 2018 年启动的首期学者培养计划。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负。在两局比赛的前 20 至 35 分钟内,它仍保持着较大的获胜机会。
OpenAI Five 在与 Blitz、Cap、Fogged、Merlini、MoonMeander 组成的 99.95 百分位 Dota 玩家队伍的三局两胜比赛中获胜,其中四人曾打过职业 Dota。比赛在直播观众面前进行,同时在线观看人数达 10 万。
OpenAI 训练出一只类人机械手,能以"前所未有的灵巧度"操控实体物体。该成果展示了机器人手部操作能力的新水平。
OpenAI Scholars 2018 首批学员已开始学习,这群经验丰富的软件开发者正转型为机器学习从业者。该项目进展可通过官方渠道持续关注。
OpenAI 宣布 OpenAI Five Benchmark 比赛已经结束。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时可生成逼真的高分辨率图像并支持高效采样。该模型还能发现可用于操控数据属性的特征,相关代码与在线可视化工具已开放。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已开始在与 Dota 2 业余人类队伍的对战中取胜。
推荐理由:OpenAI 披露由五个神经网络组成的 OpenAI Five 已能击败业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 首届 Retro Contest 已完成,该竞赛探索能够从既往经验中泛化的算法。竞赛结果现已公布。
OpenAI 用可扩展、与任务无关的系统在一组多样语言任务上取得 state-of-the-art 结果,并公开该系统。其方法结合了 Transformer 与无监督预训练两个已有思路,作者认为这为监督学习方法搭配无监督预训练的有效性提供了有说服力的例证,并希望推动在更大、更多样数据集上继续研究这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 开放 OpenAI Fellows 2018 秋季班申请,该项目提供为期 6 个月、带薪酬的 AI 研究学徒岗位。
OpenAI 发布强化学习游戏平台 Gym Retro 完整版,公开游戏数量从约 70 款 Atari 和 30 款 Sega 游戏扩展至超过 1000 款,覆盖多种模拟器后端。OpenAI 同时发布了用于向该平台添加新游戏的工具。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍计算则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 2012 年以来的训练算力数据给出 3.4 个月翻倍的经验规律,可与摩尔定律对照理解 AI 进展节奏。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断谁获胜。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
OpenAI 发起 Retro Contest 迁移学习竞赛,用于衡量强化学习算法从既往经验中泛化的能力。
OpenAI 于 3 月 3 日举办了首届黑客松,共有 100 名人工智能社区成员参与。
OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、对任务执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需黑盒访问 SGD 或 Adam 等优化器,计算效率与性能相当。
OpenAI 发布八个模拟机器人环境,以及 Hindsight Experience Replay 的 Baselines 实现,均出自其过去一年的研究。这些环境已用于训练可迁移到实体机器人的模型,OpenAI 同时发布了一组机器人研究议题。
OpenAI 将于 3 月 3 日(周六)在旧金山 Mission District 办公室举办演讲与 hackathon 活动。
OpenAI 宣布迎来新的捐赠者加入其支持者行列。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security、Electronic Frontier Foundation 等机构合著论文,预测恶意行为者可能如何滥用 AI 技术,并提出预防与缓解威胁的潜在方法。