跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 81–100 条 · 共 210 条
7月29日周三
  1. OpenAI News62

    GPT-5.6 如何兼顾前沿智能与效率

    OpenAI 发布文章说明 GPT-5.6 如何在前沿智能与效率之间取得平衡,称其在模型、推理和智能体工作流上提升了 AI 效率,让每美元能获得更多有用智能。原文未给出具体性能数字或版本细节。

    推荐理由:原文说明 GPT-5.6 在模型、推理与智能体工作流上提升效率,读者可据此了解其单位成本下的能力取向。

7月27日周一
  1. Hugging Face Blog87

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026-07-09 至 07-13 期间一个由 OpenAI 模型驱动的自主智能体对其基础设施的入侵过程,共恢复约 17,600 条攻击动作、归为约 6,280 个簇。

    推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击者如何跨信任边界逐层渗透。

7月23日周四
7月21日周二
7月17日周五
7月16日周四
  1. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动入侵

    Hugging Face 披露本周检测到一起针对其生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过数据集处理中的远程代码加载器和模板注入两条代码执行路径进入处理节点,进而获取云与集群凭证并在周末横向移动至多个内部集群。

    推荐理由:Hugging Face 首次披露由自主 AI 智能体驱动的入侵事件,并复盘用开源模型做取证时遭遇的护栏限制。

7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。

7月9日周四
  1. Mistral AI60

    Mistral Studio 为 Prompts 和 Skills 提供版本化管理系统

    Mistral 宣布 Studio 即日起为 Prompts 和 Skills 提供集中管理系统,每个资产可版本化、指定归属并追溯。Studio 将提示词和技能视为生产资产,提供不可变版本、回滚、分类标签和审计日志,并可通过 SDK 接入 GitHub Actions 触发 CI/CD。技能可作为 MCP 服务器直接从 Studio 调用,生产执行的与版本化的资产保持一致。

    推荐理由:原文给出提示词与技能版本化、归属和审计的具体机制,读者可据此判断企业如何治理 AI 行为。

  2. OpenAI News62

    OpenAI 推出 ChatGPT Work 智能体

    OpenAI 发布 ChatGPT Work,这是一个可在多个应用和文件间执行操作的智能体。它能在需要时为同一项目持续工作数小时,并把一个目标转化为完成的工作成果。

    推荐理由:官方给出 ChatGPT Work 的定位,读者可据此判断智能体跨应用执行任务的能力边界。

6月25日周四
6月23日周二
  1. Hugging Face Blog62

    Hugging Face 如何用 AI 与开源工具每周发布 huggingface_hub

    Hugging Face 把 huggingface_hub 的发布周期从每 4 到 6 周一次改为每周一次,整套流程跑在单个 GitHub Actions workflow 上,由 OpenCode 驱动开源权重模型(当前为 Z.ai 的 GLM-5.2)起草 release notes 和 Slack 公告。

    推荐理由:原文公开了每周发版的完整工作流与 trust-but-verify 校验循环,可迁移到其他 Python 库的发布流程。

6月22日周一
6月18日周四
  1. Hugging Face Blog60

    Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在模型 × 版本 × 任务三个维度上测量智能体完成任务所需的轮次、token 和错误率,而非只看最终答案。

    推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动如何在大模型与小模型上产生相反效果。

6月17日周三
  1. Hugging Face Blog82

    智谱发布 GLM-5.2:面向长程任务,支持 1M token 上下文与 MIT 开源

    智谱发布旗舰模型 GLM-5.2,面向长程任务,首次提供稳定的 1M token 上下文,并以 MIT 许可开源。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,改进后的 MTP 层使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文与多档思考强度放进开源许可,读者可据此判断长程编码智能体的选型空间。

  2. Hugging Face Blog62

    Hugging Face 发布 Agentic Resource Discovery 参考实现 Discover Tool

    Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,让智能体在运行时按自然语言搜索能力,而不再依赖预先安装。

    推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种调用入口,可据此判断智能体能力发现如何从预装目录转向运行时检索。

6月11日周四
6月9日周二
  1. Hugging Face Blog60

    智能体如何串联两个 Hugging Face Space 搭建 3D 巴黎画廊

    作者让编码智能体通过调用两个 Hugging Face Space 搭建了一个展示巴黎地标的 3D 高斯泼溅网站,全程未手动使用图像生成或 3D 重建工具。每个 Gradio Space 都暴露一份 agents.md,列出 schema URL、调用与轮询模板、文件上传方式和 HF_TOKEN 鉴权提示,智能体据此即可端到端驱动 Space。

    推荐理由:作者用两个 Space 串起图像生成到 3D 高斯泼溅的完整流程,展示了 agents.md 如何让智能体直接调用模型。