OpenAI 参与 58 位作者联合报告:提升 AI 开发可验证性的 10 种机制
OpenAI 参与撰写的多利益相关方报告提出 10 种机制,用于提升 AI 系统相关声明的可验证性。该报告由 30 家机构的 58 位共同作者完成,涵盖 Centre for the Future of Intelligence、Mila、Schwartz Reisman Institute 等。
OpenAI 参与撰写的多利益相关方报告提出 10 种机制,用于提升 AI 系统相关声明的可验证性。该报告由 30 家机构的 58 位共同作者完成,涵盖 Centre for the Future of Intelligence、Mila、Schwartz Reisman Institute 等。
OpenAI 推出 Microscope,对八个常用于可解释性研究的视觉“模式生物”模型的每个重要层和神经元进行可视化。该工具让分析这些神经网络内部形成的特征变得更容易,OpenAI 希望借此帮助研究社区理解这类复杂系统。
OpenAI 宣布将其深度学习框架标准化为 PyTorch。
OpenAI 发布 Dota 2 大规模深度强化学习研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 发现双重下降现象同样出现在 CNN、ResNet 和 Transformer 中:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化加以规避,但研究者尚不完全理解其成因,认为值得进一步研究。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向安全约束下的强化学习研究,提供配套环境与工具以评估智能体的安全表现。
OpenAI 发布 GPT-2 分阶段发布的最后一个版本,即参数量 1.5B 的最大版本,同时公开代码和模型权重,以便检测 GPT-2 模型的输出。OpenAI 表示,尽管自 8 月以来已有更大的语言模型发布,仍按原定分阶段计划推进,为社区提供一个完整分阶段发布流程的测试案例,并希望它对未来强模型的开发者有用。
推荐理由:OpenAI 按分阶段发布计划放出 GPT-2 最大版本及权重,为后续强模型的负责任发布留下一个完整案例。
OpenAI 训练了一对神经网络,用类人机械手解开魔方。神经网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。
推荐理由:OpenAI 用仿真训练加 ADR 让机械手解魔方,可了解强化学习从虚拟任务走向物理操作的一条路径。
OpenAI 现已开放第三期 OpenAI Scholars 的申请通道。该项目此前已举办两期,此次面向 2020 年度招募学员。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,呈现了标注偏好如何直接塑造模型行为。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 开发出一种评估神经网络分类器能否可靠抵御训练中未见过对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness),用于衡量单一模型面对未预期攻击时的鲁棒性。该方法强调需要在更多样化的未见攻击上衡量模型表现。
OpenAI 发布 774M 参数的 GPT-2 语言模型,此前已于 2 月发布 124M 小模型、5 月分阶段发布 355M 中等模型,并与合作伙伴及 AI 社区研究该模型被滥用的可能性和社会价值。OpenAI 同时发布一份开源法律协议,便于各组织之间建立模型共享合作,并发布一份技术报告,介绍其与更广泛 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 公布 GPT-2 分阶段发布的时间线与参数规模,可了解其模型共享与发布规范的实践。
OpenAI 将每周四设为 Learning Day,员工可选择自学日常工作中接触不到的技术技能,以提升工作能力。该安排为可选参与,学习内容聚焦于技术技能。
微软向 OpenAI 投资 10 亿美元,支持其构建具有广泛经济收益的通用人工智能(AGI)。双方将在 Microsoft Azure 内合作开发可扩展至 AGI 的硬件和软件平台,联合开发新的 Azure AI 超算技术,微软将成为 OpenAI 的独家云服务提供商。
推荐理由:OpenAI 官方披露微软 10 亿美元投资与 Azure 独家云合作,可了解双方早期算力与平台绑定关系。
OpenAI 发布政策研究论文,提出当前可用于提升 AI 安全规范长期行业合作可能性的四项策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动困境,使 AI 公司对安全投入不足。
OpenAI 于 2019 年 4 月 27 日举办了首届 OpenAI Robotics Symposium。
OpenAI Scholars 第二届八位学者完成最终项目,并在 OpenAI 的 Scholars Demo Day 上展示。
OpenAI Fellows Fall 2018 二期学员完成 6 个月学徒期,从机器学习初学者成长为 OpenAI 核心贡献者,并展示了各自的结业项目。OpenAI 目前正滚动审核 OpenAI Fellows Summer 2019 的申请。
OpenAI 发布 MuseNet,一个深度神经网络,可生成 4 分钟、包含 10 种乐器的音乐作品,并能融合从乡村到莫扎特再到披头士的风格。MuseNet 并未被显式编程音乐知识,而是通过预测数十万份 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。
推荐理由:OpenAI 公开 MuseNet 的技术路线,读者可了解其如何用 GPT-2 同款无监督方法生成多风格音乐。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测序列中下一个元素的任务上创下新纪录,可处理文本、图像和声音。它通过对注意力机制做算法改进来提取序列中的模式,可建模的序列长度是此前的 30 倍。
推荐理由:OpenAI 用稀疏注意力把可建模序列长度提升到此前 30 倍,可了解长序列建模的早期思路。
OpenAI Five 成为首个在电竞游戏中击败世界冠军的 AI,本周末在 Finals 上连续两局战胜 Dota 2 世界冠军战队 OG。此前 OpenAI Five 和 DeepMind 的 AlphaStar 都曾在私下击败优秀职业选手,但在公开职业比赛中落败,这也是 AI 首次在直播中战胜电竞职业选手。
OpenAI 将于 4 月 13 日上午 11:30(太平洋时间)举办 OpenAI Five 的最后一场直播活动。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 公布 2019 届 OpenAI Scholars 名单,8 位学者从 550 名申请者中入选。他们的专业背景涵盖文学、哲学、细胞生物学、统计学、经济学、量子物理与商业创新。
OpenAI 宣布成立 OpenAI LP,一家采用利润上限(capped-profit)结构的新公司,以便快速增加在算力和人才上的投入,同时通过制衡机制确保其使命得以实现。
推荐理由:OpenAI 官方说明其营利实体结构与利润上限安排,是理解该公司治理与使命约束的原始材料。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程将有助于识别弱点和调查失败原因。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持在持久、开放式的任务中容纳数量可变的大量智能体,多智能体与多物种的引入带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 于 2 月 2 日举办首届 Spinning Up Workshop,这是其新教育计划的一部分。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与下有效。对齐先进 AI 系统与人类价值观,需解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职从事该方向研究,以推动机器学习与社会科学的合作。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯的段落文本,在多项语言建模基准上达到当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 披露了无监督语言模型在多项语言任务上的表现,可了解早期大模型的能力边界。
OpenAI 首期 Fellows 项目结业,每位学员在 6 个月学徒期内从机器学习初学者成长为 OpenAI 的核心贡献者。该项目公布了学员的结业项目。
OpenAI 发现梯度噪声尺度这一简单统计指标可预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的泛化能力,并已帮助厘清强化学习领域一个长期存在的难题。CoinRun 在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但对当前最先进算法仍构成值得挑战的泛化测试。
OpenAI 发布 Spinning Up in Deep RL,一套面向深度强化学习的教育资料,目标是让任何人都能学习成为该领域的熟练实践者。该资源包含清晰的 RL 代码示例、教学练习、文档和教程。
OpenAI 开发了一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的概念,如 near、above、between、closest 和 furthest。该模型还展现出跨域迁移能力:在 2D 粒子环境中学习的概念可用于解决 3D 物理机器人的任务。
OpenAI 提出 Random Network Distillation(RND),一种基于预测的奖励方法,通过好奇心鼓励强化学习智能体探索环境。该方法首次在 Montezuma's Revenge 上超越人类平均表现。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把复杂任务拆解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它有望成为可扩展的 AI 安全方案。
OpenAI 开放第二届 OpenAI Scholars 项目申请,面向 underrepresented 群体提供 6–10 个津贴与导师指导名额,全职学习深度学习 3 个月并开源一个项目。