跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 101–120 条 · 共 178 条
2月20日周五
2月18日周三
  1. Hugging Face Blog63

    Hugging Face 介绍 Gradio gr.HTML 单文件构建任意 Web 应用

    Hugging Face 博客介绍 Gradio 6 中 gr.HTML 的新能力,支持自定义模板、作用域 CSS 和 JavaScript 交互,可在单个 Python 文件中完成前端、后端与状态管理,无需构建步骤即可部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.HTML 的模板、状态同步与子类化写法,读者可据此把自定义组件直接接入现有 Gradio 流程。

2月13日周五
  1. Hugging Face Blog62

    Hugging Face 发布 CUDA 内核 Agent Skill,Claude 与 Codex 为 LTX-Video 和 Qwen3-8B 生成内核

    Hugging Face 发布 cuda-kernels Agent Skill,让 Claude、Codex 等编码智能体为 diffusers 和 transformers 项目编写生产级 CUDA 内核,并生成 PyTorch 绑定与基准脚本。

    推荐理由:原文给出可安装的 CUDA 内核技能与完整基准数据,读者可据此判断智能体写内核的可行边界。

2月12日周四
  1. Hugging Face Blog60

    Hugging Face 与 Meta 的 OpenEnv 实践:在真实环境中评测工具调用智能体

    Hugging Face 博客介绍 Meta 与 Hugging Face 合作的开源框架 OpenEnv,它用 gym 风格 API(reset、step、action、observations)和标准 MCP 工具调用接口,把智能体接到浏览器、代码仓库、日历等真实系统而非模拟环境中评测。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 的 Calendar Gym 给出了智能体在真实权限与多步环境下的失败模式数据。

2月10日周二
  1. Google DeepMind74

    Google DeepMind 发布两篇论文,用 Gemini Deep Think 推进数学与科学发现

    Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。

    推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。

2月5日周四
  1. OpenAI News62

    OpenAI 发布企业级智能体平台 OpenAI Frontier

    OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限管理和治理能力。

    推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力方向,可供判断企业级 Agent 落地形态。

  2. OpenAI News78

    OpenAI 发布 GPT-5.3-Codex

    OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。

    推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。

2月2日周一
  1. OpenAI News65

    OpenAI 推出 macOS 版 Codex app

    OpenAI 发布面向 macOS 的 Codex app,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。

    推荐理由:官方给出 Codex app 的定位与多智能体、并行工作流等能力,读者可据此判断 AI 编码工具形态的变化。

1月29日周四
  1. Hugging Face Blog62

    Gradio 团队推出开源 Python 库 Daggr,用代码串联 AI 工作流并自动生成可视化画布

    Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。它支持检查任意节点输出、修改输入并单独重跑某一步,还提供状态持久化和 sheets 多工作区,安装只需 Python 3.10 以上并执行 pip install daggr。

    推荐理由:原文给出代码优先的编排方式和可视化画布,读者可据此判断它是否适合替代现有调试脚本。

1月28日周三
  1. Google Research60

    Google Research 发布智能体系统扩展研究:多智能体并非越多越好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。

    推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。

  2. Hugging Face Blog62

    Hugging Face 发布 upskill:用 Claude 生成 CUDA kernel 技能并教给开源模型

    Hugging Face 发布新工具 upskill,可用大模型生成并评测 agent skill,再交给更小或本地模型使用。文章以用 Claude Opus 4.5 编写 diffusers 模型 CUDA kernel 为例,upskill 会基于 agent trace 生成技能和测试用例,并对比有无技能时的准确率与 token 消耗。

    推荐理由:原文给出用大模型生成并评测 agent skill 再迁移到小模型的完整流程,可复用到其他专业任务。

  3. Mistral AI62

    Mistral 发布终端编码智能体 Vibe 2.0,由 Devstral 2 驱动

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的使用成本与工作流。

1月15日周四
1月7日周三
  1. OpenAI News60

    OpenAI 推出 ChatGPT Health

    OpenAI 推出 ChatGPT Health,这是一个独立的使用体验,可安全连接用户的健康数据与 App。该功能强调隐私保护,并采用由医生参与设计的方案。

    推荐理由:OpenAI 推出独立的健康使用场景,读者可了解它如何接入健康数据与 App 并处理隐私。

12月17日周三
  1. OpenAI News62

    OpenAI 开放开发者向 ChatGPT 提交应用

    OpenAI 宣布开发者可以向 ChatGPT 提交应用,经审核通过后会在产品内新的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,帮助开发者构建把真实操作带入 ChatGPT 的对话原生体验。

    推荐理由:OpenAI 开放 ChatGPT 应用提交与审核入口,开发者可据此判断自家应用进入该生态的路径。

12月13日周六
  1. Google DeepMind71

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,并推出实时语音翻译

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。

    推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。

12月11日周四
12月9日周二
  1. Mistral AI78

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布新一代编码模型家族 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源模型,分别采用修改版 MIT 和 Apache 2.0 许可。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比,便于判断开源编码模型的当前水位。