跳到正文

全部动态

今日 6 条
12月6日周三
10月26日周四
10月19日周四
10月11日周三
  1. OpenAI News62

    OpenAI 研究:自对弈让模拟 AI 自主学会擒抱、假动作等身体技能

    OpenAI 发现自对弈能让模拟 AI 在未专门设计相应环境的情况下,自行发现擒抱、闪避、假动作、踢球、接球和扑球等身体技能。自对弈还能让环境难度始终与 AI 水平匹配,从而持续推动其进步。结合 Dota 2 的自对弈结果,OpenAI 表示越来越相信自对弈将成为未来强大 AI 系统的核心组成部分。

    推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可了解自对弈作为训练范式的早期思路。

9月14日周四
8月16日周三
  1. OpenAI News88

    OpenAI 详解 Dota 2 自对弈训练结果

    OpenAI 发文说明其 Dota 2 结果:在算力充足时,自对弈能把机器学习系统的表现从远低于人类水平提升到超人水平。该系统在一个月内从勉强与高排名玩家打平,进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 指出,监督式深度学习系统的上限取决于训练数据集,而自对弈系统中可用数据会随智能体变强而自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在充足算力下能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News80

    OpenAI 打造在 Dota 2 1v1 中击败顶级职业选手的机器人

    OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。

7月27日周四
7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 Proximal Policy Optimization(PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且表现良好,已成为 OpenAI 的默认强化学习算法。

    推荐理由:OpenAI 公开了 PPO 这一强化学习算法,读者可了解它为何成为其默认训练方法。

7月17日周一
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要的目标。该方法旨在减少人工编写目标函数的需求,因为用简单代理替代复杂目标或目标设定稍有偏差,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,读者可了解早期对齐研究的一条思路。

6月8日周四
  1. OpenAI News20

    OpenAI:让 AI 智能体学会合作、竞争与沟通

    OpenAI 指出,智能体争夺资源的多智能体环境是通往 AGI 的必经之路。这类环境具备两个有用特性:难度由竞争对手的技能水平自然决定,形成天然课程;且不存在稳定均衡,智能体始终面临变得更聪明的压力。OpenAI 表示,这类环境与传统环境差异很大,仍需大量研究才能驾驭。

5月16日周二
4月6日周四
4月1日周六
3月24日周五
3月16日周四
2月24日周五
12月21日周三
6月21日周二
6月16日周四