跳到正文

#Agent

今日 4 条
3月23日周四
  1. OpenAI News82

    OpenAI 为 ChatGPT 推出插件支持

    OpenAI 宣布在 ChatGPT 中实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。

    推荐理由:OpenAI 为 ChatGPT 引入插件机制,读者可了解语言模型接入实时信息与第三方服务的最初形态。

1月1日周日
6月23日周四
  1. OpenAI News70

    OpenAI 用视频预训练让神经网络学会玩 Minecraft

    OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。

    推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。

9月17日周二
  1. OpenAI News62

    OpenAI 在多智能体交互中观察到智能体自发使用工具

    OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。

    推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。

3月4日周一
12月6日周四
8月23日周四
8月6日周一
7月4日周三
  1. OpenAI News62

    OpenAI 从单次演示中学习 Montezuma's Revenge

    OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。

6月25日周一
10月26日周四
9月14日周四
8月11日周五
  1. OpenAI News80

    OpenAI 打造在 Dota 2 1v1 中击败顶级职业选手的机器人

    OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。

6月8日周四
  1. OpenAI News20

    OpenAI:让 AI 智能体学会合作、竞争与沟通

    OpenAI 指出,智能体争夺资源的多智能体环境是通往 AGI 的必经之路。这类环境具备两个有用特性:难度由竞争对手的技能水平自然决定,形成天然课程;且不存在稳定均衡,智能体始终面临变得更聪明的压力。OpenAI 表示,这类环境与传统环境差异很大,仍需大量研究才能驾驭。

3月16日周四
12月5日周一
  1. OpenAI News62

    OpenAI 发布 Universe 软件平台

    OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。

    推荐理由:OpenAI 官方给出 Universe 的定位与覆盖范围,读者可据此了解这一通用智能训练平台的用途。