跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 161–178 条 · 共 178 条
11月18日周一
10月1日周二
8月6日周二
  1. OpenAI News62

    OpenAI 在 API 中推出结构化输出

    OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。

    推荐理由:OpenAI 在 API 中引入结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema,便于构建可靠的下游流程。

7月23日周二
  1. Hugging Face Blog87

    Llama 3.1 发布:8B、70B、405B 三尺寸,支持 128K 上下文与多语言

    Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。

    推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。

7月1日周一
  1. Hugging Face Blog60

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。

5月13日周一
  1. Hugging Face Blog71

    Hugging Face 发布 Transformers Agents 2.0

    Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。

    推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。

2月26日周一
  1. Mistral AI62

    Mistral AI 发布对话助手 le Chat 及企业版 le Chat Enterprise

    Mistral AI 发布对话助手 le Chat Mistral,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 le Chat Enterprise,支持自部署和细粒度审核机制,le Chat 目前以 beta 形式开放注册,暂不能联网,可能给出不准确或过时信息。

    推荐理由:Mistral 官方给出对话助手的模型选择、企业自部署与审核机制,可据此判断其产品定位。

12月11日周一
11月6日周一
7月20日周四
  1. OpenAI News62

    OpenAI 为 ChatGPT 推出自定义指令功能

    OpenAI 为 ChatGPT 推出自定义指令功能,用户可设置自己的偏好,ChatGPT 会在之后的所有对话中记住这些偏好。该功能让用户对 ChatGPT 的回复方式拥有更多控制权。

    推荐理由:原文给出自定义指令的开放范围与生效方式,读者可据此判断 ChatGPT 个性化设置会如何影响日常对话。

3月23日周四
  1. OpenAI News82

    OpenAI 为 ChatGPT 推出插件支持

    OpenAI 宣布在 ChatGPT 中实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。

    推荐理由:OpenAI 为 ChatGPT 引入插件机制,读者可了解语言模型接入实时信息与第三方服务的最初形态。

6月23日周四
  1. OpenAI News70

    OpenAI 用视频预训练让神经网络学会玩 Minecraft

    OpenAI 提出 Video PreTraining(VPT)方法,在大量无标注的人类玩 Minecraft 视频数据上训练神经网络,仅使用少量承包商标注数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 多分钟、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,通用性较强,是迈向通用计算机使用智能体的一步。

    推荐理由:OpenAI 用少量标注数据加海量无标注视频训练出能玩 Minecraft 的模型,可了解视频预训练这条路径的早期做法。

9月17日周二
  1. OpenAI News62

    OpenAI 在多智能体交互中观察到智能体自发使用工具

    OpenAI 在自建的模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用越来越复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种简单环境中自监督涌现出的复杂性,说明多智能体协同适应未来可能产生极其复杂且智能的行为。

    推荐理由:OpenAI 在自建捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。

8月6日周一
7月4日周三
  1. OpenAI News62

    OpenAI 从单次演示中学习 Montezuma's Revenge

    OpenAI 训练出一个智能体,仅凭单次人类演示就在 Montezuma's Revenge 上取得 74,500 分的高分,优于此前已发表的任何结果。其算法思路是让智能体从演示中精心挑选的状态出发连续进行游戏,并用 PPO 优化游戏得分,PPO 也是支撑 OpenAI Five 的同一强化学习算法。

    推荐理由:OpenAI 用单次人类演示让智能体在 Montezuma's Revenge 上取得 74,500 分,可了解其基于 PPO 的简洁训练思路。

6月25日周一
8月11日周五
  1. OpenAI News80

    OpenAI 打造在 Dota 2 1v1 中击败顶级职业选手的机器人

    OpenAI 创建了一个在标准锦标赛规则下、于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人通过自我对弈从零学习游戏,不使用模仿学习或树搜索。OpenAI 称这是朝着构建能在涉及真实人类的混乱复杂情境中完成明确目标的人工智能系统迈出的一步。

    推荐理由:OpenAI 用自我对弈从零训练出击败 Dota 2 顶级选手的机器人,读者可了解其不依赖模仿学习与树搜索的训练路径。

12月5日周一
  1. OpenAI News62

    OpenAI 发布 Universe 软件平台

    OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球范围内的游戏、网站及其他应用。

    推荐理由:OpenAI 官方给出 Universe 的定位与覆盖范围,读者可据此了解这一通用智能训练平台的用途。