跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 61–80 条 · 共 82 条
2月2日周三
1月27日周四
  1. OpenAI News78

    OpenAI 用对齐研究让语言模型更好遵循指令

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型,同时更真实、毒性更低,所用技术来自其对齐研究。这些名为 InstructGPT 的模型采用人类参与训练的方式,现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 说明 InstructGPT 如何通过人类反馈训练,让模型更贴合用户意图并成为 API 默认模型。

12月16日周四
10月29日周五
  1. OpenAI News62

    OpenAI 训练系统解小学数学应用题,准确率约为微调 GPT-3 的两倍

    OpenAI 训练了一个求解小学阶段数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,与真实儿童相当:9-12 岁小样本在其数据集测试中得分 60%,系统在同一批题目上得分 55%。

    推荐理由:OpenAI 用小学数学应用题对比微调 GPT-3 与儿童成绩,可了解当时模型解题能力的实际水平。

3月4日周四
  1. OpenAI News62

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以字面、符号还是概念化形式呈现,这些神经元都会产生响应。OpenAI 表示,这或许能解释 CLIP 为何能准确分类出人意料的概念视觉呈现,也是理解 CLIP 及类似模型所学关联与偏置的重要一步。

    推荐理由:OpenAI 公开了 CLIP 中多模态神经元的发现,为理解模型如何跨形式关联概念提供了线索。

6月17日周三
  1. OpenAI News62

    OpenAI 发布 Image GPT:用 Transformer 生成图像

    OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。

    推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。

5月5日周二
  1. OpenAI News62

    OpenAI 分析:训练神经网络达到 AlexNet 水平所需算力比 2012 年减少 44 倍

    OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类任务上训练神经网络达到同等性能所需的算力每 16 个月减少一半。与 2012 年相比,如今训练一个达到 AlexNet 水平的神经网络所需算力减少 44 倍,而同期摩尔定律带来的成本改善为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率的提升。

    推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步,读者可据此理解算法效率与硬件效率的相对贡献。

12月13日周五
10月15日周二
  1. OpenAI News70

    OpenAI 用机械手解魔方

    OpenAI 训练了一对神经网络,用类人机械手解开魔方。神经网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要高灵巧度的物理世界问题。

    推荐理由:OpenAI 用仿真训练加 ADR 让机械手解魔方,可了解强化学习从虚拟任务走向物理操作的一条路径。

9月19日周四
9月17日周二
  1. OpenAI News62

    OpenAI 在多智能体交互中观察到智能体自发使用工具

    OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。

    推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。

4月23日周二
  1. OpenAI News62

    OpenAI 提出 Sparse Transformer,可建模序列长度提升 30 倍

    OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测序列中下一个元素的任务上创下新纪录,可处理文本、图像和声音。它通过对注意力机制做算法改进来提取序列中的模式,可建模的序列长度是此前的 30 倍。

    推荐理由:OpenAI 用稀疏注意力把可建模序列长度提升到此前 30 倍,可了解长序列建模的早期思路。

7月4日周三
  1. OpenAI News62

    OpenAI 从单次演示中学习 Montezuma's Revenge

    OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。

6月25日周一
6月11日周一
  1. OpenAI News85

    OpenAI 用无监督预训练提升语言理解能力

    OpenAI 用可扩展、与任务无关的系统在一组多样语言任务上取得 state-of-the-art 结果,并公开该系统。其方法结合了 Transformer 与无监督预训练两个已有思路,作者认为这为监督学习方法搭配无监督预训练的有效性提供了有说服力的例证,并希望推动在更大、更多样数据集上继续研究这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。

5月16日周三
  1. OpenAI News85

    OpenAI 分析:最大 AI 训练算力自 2012 年起每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍计算则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用 2012 年以来的训练算力数据给出 3.4 个月翻倍的经验规律,可与摩尔定律对照理解 AI 进展节奏。

10月11日周三
  1. OpenAI News62

    OpenAI 研究:自对弈让模拟 AI 自主学会擒抱、假动作等身体技能

    OpenAI 发现自对弈能让模拟 AI 在未专门设计相应环境的情况下,自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能。自对弈还能让环境难度始终与 AI 水平匹配,从而持续推动其进步。结合 Dota 2 的自对弈结果,OpenAI 表示越来越相信自对弈将成为未来强大 AI 系统的核心组成部分。

    推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可了解自对弈作为训练范式的早期思路。

8月16日周三
  1. OpenAI News88

    OpenAI 详解 Dota 2 自对弈训练结果

    OpenAI 发文说明其 Dota 2 结果:在算力充足时,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在充足算力下能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News80

    OpenAI 打造在 Dota 2 1v1 中击败顶级职业选手的机器人

    OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。

7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 Proximal Policy Optimization(PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且表现良好,已成为 OpenAI 的默认强化学习算法。

    推荐理由:OpenAI 公开了 PPO 这一强化学习算法,读者可了解它为何成为其默认训练方法。