OpenAI 发布块稀疏 GPU 内核
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。团队已用这些内核在文本情感分析和文本、图像生成建模上取得 SOTA 结果。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。团队已用这些内核在文本情感分析和文本、图像生成建模上取得 SOTA 结果。
OpenAI 开发出一种分层强化学习算法,能学习可解决多种任务的高层动作,从而快速求解需要数千个 timestep 的任务。该算法应用于一组导航问题时,自动发现了向不同方向行走和爬行的高层动作集合,使智能体能够快速掌握新的导航任务。
OpenAI 的机器人技术让完全在仿真中训练、部署到实体机器人上的控制器,能在执行简单任务时对环境中未预料的变化做出反应,即从开环系统转为闭环系统。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体能快速学会击败更强的非元学习智能体,并能适应自身物理故障。
OpenAI 发现自对弈能让模拟 AI 在未专门设计相应环境的情况下,自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能。自对弈还能让环境难度始终与 AI 水平匹配,从而持续推动其进步。结合 Dota 2 的自对弈结果,OpenAI 表示越来越相信自对弈将成为未来强大 AI 系统的核心组成部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可了解自对弈作为训练范式的早期思路。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习这一事实,从而在迭代囚徒困境中发现互惠合作式的自利策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI 发文说明其 Dota 2 结果:在算力充足时,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统中可用数据会随智能体变强而自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在充足算力下能把系统从远低于人类提升到超人水平。
OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。
推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且表现良好,已成为 OpenAI 的默认强化学习算法。
推荐理由:OpenAI 公开了 PPO 这一强化学习算法,读者可了解它为何成为其默认训练方法。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定骗过神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要的目标。该方法旨在减少人工编写目标函数的需求,因为用简单代理替代复杂目标或目标设定稍有偏差,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,读者可了解早期对齐研究的一条思路。
OpenAI 指出,智能体争夺资源的多智能体环境是通往 AGI 的必经之路。这类环境具备两个有用特性:难度由竞争对手的技能水平自然决定,形成天然课程;且不存在稳定均衡,智能体始终面临变得更聪明的压力。OpenAI 表示,这类环境与传统环境差异很大,仍需大量研究才能驾驭。
OpenAI 创建了一套机器人系统,完全在模拟环境中训练,并部署到实体机器人上。该系统在看过一次任务演示后就能学会新任务。
推荐理由:OpenAI 展示了一套完全在模拟中训练、可直接部署到实体机器人的系统,读者可了解其单次示范学习新任务的能力。
OpenAI 开发出一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,就学到了出色的情感表征。该系统被称为无监督情感神经元。
OpenAI 称已打造出全球首个垃圾邮件检测 AI,完全在仿真环境中训练,并部署在实体机器人上。该 AI 将垃圾邮件检测从数字世界延伸到物理世界。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)技术相媲美,同时规避了 RL 的诸多不便。
OpenAI 发布新研究,介绍智能体在训练中发展出各自语言的过程。原文仅给出这一概述,未披露具体方法、实验设置或结果。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于给机器看的视错觉。OpenAI 展示了对抗样本在不同媒介上的表现,并讨论了为何防御这类攻击十分困难。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式被"钻空子",从而偏离设计者的本意。
OpenAI 与 Berkeley、Stanford 的研究者共同合著了 Google Brain 主导的论文《Concrete Problems in AI Safety》,探讨如何确保现代机器学习系统按预期运行。论文梳理了围绕这一目标的诸多研究问题。
OpenAI 介绍了四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及未来可能的发展方向。