跳到正文

#数据/训练

今日 6 条
4月22日周五
4月12日周二
3月28日周一
3月3日周四
2月11日周五
1月21日周五
12月23日周四
12月8日周三
11月30日周二
10月29日周五
  1. OpenAI News62

    OpenAI 训练系统解小学数学应用题,准确率约为微调 GPT-3 的两倍

    OpenAI 训练了一个求解小学阶段数学应用题的系统,准确率约为微调 GPT-3 模型的两倍。该系统能解出约 90% 的题目数量,与真实儿童相当:9-12 岁小样本在其数据集测试中得分 60%,系统在同一批题目上得分 55%。

    推荐理由:OpenAI 用小学数学应用题对比微调 GPT-3 与儿童成绩,可了解当时模型解题能力的实际水平。

9月23日周四
6月10日周四
5月10日周一
9月4日周五
6月17日周三
  1. OpenAI News62

    OpenAI 发布 Image GPT:用 Transformer 生成图像

    OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。

    推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。

5月5日周二
  1. OpenAI News62

    OpenAI 分析:训练神经网络达到 AlexNet 水平所需算力比 2012 年减少 44 倍

    OpenAI 发布一项分析,指出自 2012 年以来,在 ImageNet 分类任务上训练神经网络达到同等性能所需的算力每 16 个月减少一半。与 2012 年相比,如今训练一个达到 AlexNet 水平的神经网络所需算力减少 44 倍,而同期摩尔定律带来的成本改善为 11 倍。分析认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率的提升。

    推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步,读者可据此理解算法效率与硬件效率的相对贡献。

12月5日周四
12月3日周二
11月21日周四
11月5日周二
  1. OpenAI News78

    OpenAI 发布 GPT-2 最大版本 1.5B 及代码与模型权重

    OpenAI 发布 GPT-2 分阶段发布的最后一个版本,即参数量 1.5B 的最大版本,同时公开代码和模型权重,以便检测 GPT-2 模型的输出。OpenAI 表示,尽管自 8 月以来已有更大的语言模型发布,仍按原定分阶段计划推进,为社区提供一个完整分阶段发布流程的测试案例,并希望它对未来强模型的开发者有用。

    推荐理由:OpenAI 按分阶段发布计划放出 GPT-2 最大版本及权重,为后续强模型的负责任发布留下一个完整案例。

9月19日周四
8月20日周二
  1. OpenAI News70

    OpenAI 发布 774M 参数 GPT-2 模型并公开模型共享法律协议

    OpenAI 发布 774M 参数的 GPT-2 语言模型,此前已于 2 月发布 124M 小模型、5 月分阶段发布 355M 中等模型,并与合作伙伴及 AI 社区研究该模型被滥用的可能性和社会价值。OpenAI 同时发布一份开源法律协议,便于各组织之间建立模型共享合作,并发布一份技术报告,介绍其与更广泛 AI 研究社区协调发布规范的经验。

    推荐理由:OpenAI 公布 GPT-2 分阶段发布的时间线与参数规模,可了解其模型共享与发布规范的实践。

4月23日周二
  1. OpenAI News62

    OpenAI 提出 Sparse Transformer,可建模序列长度提升 30 倍

    OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测序列中下一个元素的任务上创下新纪录,可处理文本、图像和声音。它通过对注意力机制做算法改进来提取序列中的模式,可建模的序列长度是此前的 30 倍。

    推荐理由:OpenAI 用稀疏注意力把可建模序列长度提升到此前 30 倍,可了解长序列建模的早期思路。

3月21日周四
3月6日周三
2月26日周二
2月14日周四
  1. OpenAI News85

    OpenAI 训练出大规模无监督语言模型,多项语言任务无需特定训练

    OpenAI 训练了一个大规模无监督语言模型,能生成连贯的段落文本,在多项语言建模基准上达到当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。

    推荐理由:OpenAI 披露了无监督语言模型在多项语言任务上的表现,可了解早期大模型的能力边界。

12月14日周五
11月7日周三
10月11日周四
6月11日周一
  1. OpenAI News85

    OpenAI 用无监督预训练提升语言理解能力

    OpenAI 用可扩展、与任务无关的系统在一组多样语言任务上取得 state-of-the-art 结果,并公开该系统。其方法结合了 Transformer 与无监督预训练两个已有思路,作者认为这为监督学习方法搭配无监督预训练的有效性提供了有说服力的例证,并希望推动在更大、更多样数据集上继续研究这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套与任务无关的系统。

5月25日周五
5月16日周三
  1. OpenAI News85

    OpenAI 分析:最大 AI 训练算力自 2012 年起每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。该指标自 2012 年以来增长超过 300,000 倍,若按 2 年翻倍计算则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用 2012 年以来的训练算力数据给出 3.4 个月翻倍的经验规律,可与摩尔定律对照理解 AI 进展节奏。

4月18日周三
4月5日周四
3月7日周三
  1. OpenAI News42

    OpenAI 提出可扩展元学习算法 Reptile

    OpenAI 开发出可扩展元学习算法 Reptile,通过反复采样任务、对任务执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是 Shortest Descent 算法在元学习场景的应用,数学上与一阶 MAML 相似,只需黑盒访问 SGD 或 Adam 等优化器,计算效率与性能相当。

2月7日周三
12月6日周三
10月19日周四
10月11日周三