TAPEX:无需真实数据的高效表格预训练
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
OpenAI 发布研究《Hierarchical text-conditional image generation with CLIP latents》,提出一种基于 CLIP latents 的分层文本条件图像生成方法。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够解出多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的题目。
推荐理由:OpenAI 用 Lean 神经定理证明器解出 AMC12、AIME 及两道改编自 IMO 的题目,可了解形式化数学推理的早期进展。
OpenAI 对 GPT-3 进行微调,使其借助基于文本的网页浏览器更准确地回答开放式问题,并将该工作命名为 WebGPT。
推荐理由:OpenAI 用文本浏览器微调 GPT-3 提升开放问答的事实准确率,可了解早期检索增强思路。
OpenAI 训练了一个求解小学阶段数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,与真实儿童相当:9-12 岁小样本在其数据集测试中得分 60%,系统在同一批题目上得分 55%。
推荐理由:OpenAI 用小学数学应用题对比微调 GPT-3 与儿童成绩,可了解当时模型解题能力的实际水平。
OpenAI 发布关于用人类反馈总结书籍的研究,聚焦如何对难以评估的任务扩大人类监督规模。
OpenAI 研究发现,用一个小规模精选数据集对语言模型进行微调,即可改善其在特定行为价值观方面的表现。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以字面、符号还是概念化形式呈现,这些神经元都会产生响应。OpenAI 表示,这或许能解释 CLIP 为何能准确分类出人意料的概念视觉呈现,也是理解 CLIP 及类似模型所学关联与偏置的重要一步。
推荐理由:OpenAI 公开了 CLIP 中多模态神经元的发现,为理解模型如何跨形式关联概念提供了线索。
OpenAI 将人类反馈强化学习(RLHF)应用于语言模型训练,使其在摘要任务上表现更好。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类任务上训练神经网络达到同等性能所需的算力每 16 个月减少一半。与 2012 年相比,如今训练一个达到 AlexNet 水平的神经网络所需算力减少 44 倍,而同期摩尔定律带来的成本改善为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率的提升。
推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步,读者可据此理解算法效率与硬件效率的相对贡献。
OpenAI 发布 Dota 2 大规模深度强化学习研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 发现双重下降现象同样出现在 CNN、ResNet 和 Transformer 中:随着模型规模、数据量或训练时间增加,性能先提升、再变差、然后再次提升。这一效应通常可通过精细的正则化加以规避,但研究者尚不完全理解其成因,认为值得进一步研究。
OpenAI 发布 Procgen Benchmark,包含 16 个易于使用的程序化生成环境,用于直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向安全约束下的强化学习研究,提供配套环境与工具以评估智能体的安全表现。
OpenAI 训练了一对神经网络,用类人机械手解开魔方。神经网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。
推荐理由:OpenAI 用仿真训练加 ADR 让机械手解魔方,可了解强化学习从虚拟任务走向物理操作的一条路径。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,呈现了标注偏好如何直接塑造模型行为。
OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。
推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI 开发出一种评估神经网络分类器能否可靠抵御训练中未见过对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness),用于衡量单一模型面对未预期攻击时的鲁棒性。该方法强调需要在更多样化的未见攻击上衡量模型表现。
OpenAI 发布政策研究论文,提出当前可用于提升 AI 安全规范长期行业合作可能性的四项策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动困境,使 AI 公司对安全投入不足。
OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测序列中下一个元素的任务上创下新纪录,可处理文本、图像和声音。它通过对注意力机制做算法改进来提取序列中的模式,可建模的序列长度是此前的 30 倍。
推荐理由:OpenAI 用稀疏注意力把可建模序列长度提升到此前 30 倍,可了解长序列建模的早期思路。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量和泛化能力优于现有模型。EBM 生成时投入更多算力持续精修答案,在低温下可生成与 GAN 媲美的样本,同时具备似然类模型的模式覆盖保证。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程将有助于识别弱点和调查失败原因。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持在持久、开放式的任务中容纳数量可变的大量智能体,多智能体与多物种的引入带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与下有效。对齐先进 AI 系统与人类价值观,需解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职从事该方向研究,以推动机器学习与社会科学的合作。
OpenAI 发现梯度噪声尺度这一简单统计指标可预测神经网络训练在多种任务上的可并行性。由于复杂任务的梯度噪声更大,未来更大的 batch size 可能变得有用,从而消除 AI 系统继续扩展的一项潜在限制。
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的泛化能力,并已帮助厘清强化学习领域一个长期存在的难题。CoinRun 在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但对当前最先进算法仍构成值得挑战的泛化测试。
OpenAI 开发了一种基于能量的模型,仅需五次演示即可学会识别并生成以 2D 点集表达的概念,如 near、above、between、closest 和 furthest。该模型还展现出跨域迁移能力:在 2D 粒子环境中学习的概念可用于解决 3D 物理机器人的任务。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把复杂任务拆解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它有望成为可扩展的 AI 安全方案。
OpenAI 训练出一只类人机械手,能以"前所未有的灵巧度"操控实体物体。该成果展示了机器人手部操作能力的新水平。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时可生成逼真的高分辨率图像并支持高效采样。该模型还能发现可用于操控数据属性的特征,相关代码与在线可视化工具已开放。
OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。
OpenAI 首届 Retro Contest 已完成,该竞赛探索能够从既往经验中泛化的算法。竞赛结果现已公布。
OpenAI 用可扩展、与任务无关的系统在一组多样语言任务上取得 state-of-the-art 结果,并公开该系统。其方法结合了 Transformer 与无监督预训练两个已有思路,作者认为这为监督学习方法搭配无监督预训练的有效性提供了有说服力的例证,并希望推动在更大、更多样数据集上继续研究这一思路。
推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。
OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍计算则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。
推荐理由:OpenAI 用 2012 年以来的训练算力数据给出 3.4 个月翻倍的经验规律,可与摩尔定律对照理解 AI 进展节奏。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断谁获胜。
OpenAI 发布实验性元学习方法 Evolved Policy Gradients(EPG),通过进化学习智能体的损失函数,使其能在新任务上快速训练。用 EPG 训练的智能体可在测试时完成训练范围之外的基础任务,例如学会导航到房间中与训练时放置位置相反一侧的物体。
OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、对任务执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需黑盒访问 SGD 或 Adam 等优化器,计算效率与性能相当。
OpenAI 发布八个模拟机器人环境,以及 Hindsight Experience Replay 的 Baselines 实现,均出自其过去一年的研究。这些环境已用于训练可迁移到实体机器人的模型,OpenAI 同时发布了一组机器人研究议题。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security、Electronic Frontier Foundation 等机构合著论文,预测恶意行为者可能如何滥用 AI 技术,并提出预防与缓解威胁的潜在方法。