OpenAI 为 ChatGPT 推出插件支持
OpenAI 宣布在 ChatGPT 中实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。
推荐理由:OpenAI 为 ChatGPT 引入插件机制,读者可了解语言模型接入实时信息与第三方服务的最初形态。
OpenAI 宣布在 ChatGPT 中实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。
推荐理由:OpenAI 为 ChatGPT 引入插件机制,读者可了解语言模型接入实时信息与第三方服务的最初形态。
OpenAI 正利用 GPT-3 创建新一代 AI 驱动的角色。该方向聚焦于以 GPT-3 生成更具表现力的虚拟角色,具体产品形态与可用性尚未披露。
OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。
推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持在持久、开放式的任务中容纳数量可变的大量智能体,多智能体与多物种的引入带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的泛化能力,并已帮助厘清强化学习领域一个长期存在的难题。CoinRun 在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但对当前最先进算法仍构成值得挑战的泛化测试。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负。在两局比赛的前 20 至 35 分钟内,它仍保持着较大的获胜机会。
OpenAI Five 在与 Blitz、Cap、Fogged、Merlini、MoonMeander 组成的 99.95 百分位 Dota 玩家队伍的三局两胜比赛中获胜,其中四人曾打过职业 Dota。比赛在直播观众面前进行,同时在线观看人数达 10 万。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已开始在与 Dota 2 业余人类队伍的对战中取胜。
推荐理由:OpenAI 披露由五个神经网络组成的 OpenAI Five 已能击败业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 开发出一种分层强化学习算法,能学习可解决多种任务的高层动作,从而快速求解需要数千个 timestep 的任务。该算法应用于一组导航问题时,自动发现了向不同方向行走和爬行的高层动作集合,使智能体能够快速掌握新的导航任务。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习这一事实,从而在迭代囚徒困境中发现互惠合作式的自利策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。
OpenAI 指出,智能体争夺资源的多智能体环境是通往 AGI 的必经之路。这类环境具备两个有用特性:难度由竞争对手的技能水平自然决定,形成天然课程;且不存在稳定均衡,智能体始终面临变得更聪明的压力。OpenAI 表示,这类环境与传统环境差异很大,仍需大量研究才能驾驭。
OpenAI 发布新研究,介绍智能体在训练中发展出各自语言的过程。原文仅给出这一概述,未披露具体方法、实验设置或结果。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。
推荐理由:OpenAI 官方给出 Universe 的定位与覆盖范围,读者可据此了解这一通用智能训练平台的用途。