OpenAI 用人类偏好微调 774M 参数 GPT-2
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,呈现了标注偏好如何直接塑造模型行为。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,呈现了标注偏好如何直接塑造模型行为。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 发布 774M 参数的 GPT-2 语言模型,此前已于 2 月发布 124M 小模型、5 月分阶段发布 355M 中等模型,并与合作伙伴及 AI 社区研究该模型被滥用的可能性和社会价值。OpenAI 同时发布一份开源法律协议,便于各组织之间建立模型共享合作,并发布一份技术报告,介绍其与更广泛 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 公布 GPT-2 分阶段发布的时间线与参数规模,可了解其模型共享与发布规范的实践。
微软向 OpenAI 投资 10 亿美元,支持其构建具有广泛经济收益的通用人工智能(AGI)。双方将在 Microsoft Azure 内合作开发可扩展至 AGI 的硬件和软件平台,联合开发新的 Azure AI 超算技术,微软将成为 OpenAI 的独家云服务提供商。
推荐理由:OpenAI 官方披露微软 10 亿美元投资与 Azure 独家云合作,可了解双方早期算力与平台绑定关系。
OpenAI 发布 MuseNet,一个深度神经网络,可生成 4 分钟、包含 10 种乐器的音乐作品,并能融合从乡村到莫扎特再到披头士的风格。MuseNet 并未被显式编程音乐知识,而是通过预测数十万份 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。
推荐理由:OpenAI 公开 MuseNet 的技术路线,读者可了解其如何用 GPT-2 同款无监督方法生成多风格音乐。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测序列中下一个元素的任务上创下新纪录,可处理文本、图像和声音。它通过对注意力机制做算法改进来提取序列中的模式,可建模的序列长度是此前的 30 倍。
推荐理由:OpenAI 用稀疏注意力把可建模序列长度提升到此前 30 倍,可了解长序列建模的早期思路。
OpenAI Five 成为首个在电竞游戏中击败世界冠军的 AI,本周末在 Finals 上连续两局战胜 Dota 2 世界冠军战队 OG。此前 OpenAI Five 和 DeepMind 的 AlphaStar 都曾在私下击败优秀职业选手,但在公开职业比赛中落败,这也是 AI 首次在直播中战胜电竞职业选手。
OpenAI 宣布成立 OpenAI LP,一家采用利润上限(capped-profit)结构的新公司,以便快速增加在算力和人才上的投入,同时通过制衡机制确保其使命得以实现。
推荐理由:OpenAI 官方说明其营利实体结构与利润上限安排,是理解该公司治理与使命约束的原始材料。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯的段落文本,在多项语言建模基准上达到当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 披露了无监督语言模型在多项语言任务上的表现,可了解早期大模型的能力边界。
OpenAI Five 在与 Blitz、Cap、Fogged、Merlini、MoonMeander 组成的 99.95 百分位 Dota 玩家队伍的三局两胜比赛中获胜,其中四人曾打过职业 Dota。比赛在直播观众面前进行,同时在线观看人数达 10 万。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已开始在与 Dota 2 业余人类队伍的对战中取胜。
推荐理由:OpenAI 披露由五个神经网络组成的 OpenAI Five 已能击败业余人类队伍,可了解早期多智能体协作的进展。
OpenAI 用可扩展、与任务无关的系统在一组多样语言任务上取得 state-of-the-art 结果,并公开该系统。其方法结合了 Transformer 与无监督预训练两个已有思路,作者认为这为监督学习方法搭配无监督预训练的有效性提供了有说服力的例证,并希望推动在更大、更多样数据集上继续研究这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍计算则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 2012 年以来的训练算力数据给出 3.4 个月翻倍的经验规律,可与摩尔定律对照理解 AI 进展节奏。
OpenAI 发现自对弈能让模拟 AI 在未专门设计相应环境的情况下,自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能。自对弈还能让环境难度始终与 AI 水平匹配,从而持续推动其进步。结合 Dota 2 的自对弈结果,OpenAI 表示越来越相信自对弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可了解自对弈作为训练范式的早期思路。
OpenAI 发文说明其 Dota 2 结果:在算力充足时,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统中可用数据会随智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在充足算力下能把系统从远低于人类提升到超人水平。
OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且表现良好,已成为 OpenAI 的默认强化学习算法。
推荐理由:OpenAI 公开了 PPO 这一强化学习算法,读者可了解它为何成为其默认训练方法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要的目标。该方法旨在减少人工编写目标函数的需求,因为用简单代理替代复杂目标或目标设定稍有偏差,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,读者可了解早期对齐研究的一条思路。
OpenAI 创建了一套机器人系统,完全在模拟环境中训练,并部署到实体机器人上。该系统在看过一次任务演示后就能学会新任务。
推荐理由:OpenAI 展示了一套完全在模拟中训练、可直接部署到实体机器人的系统,读者可了解其单次示范学习新任务的能力。