跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 61–80 条 · 共 210 条
9月5日周六
  1. GitHub Blog · AI & ML66

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,在运行时通过多模型编排完成任务,已面向所有 GitHub Copilot 套餐开放,可在 GitHub Copilot CLI 中通过 /experimental 启用。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。

9月3日周四
  1. OpenAI News84

    OpenAI 发布 GPT-6 Astra 新一代模型

    OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。

    推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。

  2. Google DeepMind60

    Google DeepMind 推出 Fairwind Program,向政府和企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放其最先进的网络模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出了面向政府和企业的受限访问计划与配套模型组合,读者可了解其准入范围与责任约束。

  3. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。

8月29日周六
  1. X:SpaceXAI (@SpaceXAI)65

    Grok 4.6 上线 Grok.com、iOS 和 Android

    Grok 4.6 现已在 Grok.com、iOS 和 Android 上线。官方建议将其用于复杂问题、智能体式查询以及构建应用等场景。

    推荐理由:Grok 4.6 已在网页与移动端开放,读者可据此了解新版本覆盖的入口和官方给出的三类使用场景。

8月28日周五
  1. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自动完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程缩短到几分钟。

    推荐理由:原文给出PPE在公共卫生、粮食安全与疫情预测上的基准对比,可了解地理空间建模自动化的能力边界。

8月27日周四
  1. X:美团 LongCat (@Meituan_LongCat)78

    美团 LongCat-2.0 上线 TokenRhythm,1.6T MoE 原生 1M 上下文并开放 MIT 权重

    LongCat-2.0 已在 TokenRhythm 上线,采用 1.6T MoE 架构、约 48B 激活参数、原生 1M 上下文,并以 MIT 许可开放权重。该模型全程在国内 AI ASIC 超算集群上训练,面向仓库级编码和智能体工作流,可通过 OpenSquilla 使用。

    推荐理由:LongCat-2.0 的参数量、激活规模、上下文长度与开源许可集中披露,可据此判断它在代码与智能体场景的定位。

  2. Google DeepMind71

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。

    推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。

8月25日周二
8月20日周四
8月19日周三
  1. Hugging Face Blog62

    ALTK-Evolve 研究:智能体到底需要多少记忆

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务评测八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型对比给出了智能体记忆的三种剂量模式与 token 开销数据,可据此判断自家模型该用全量还是检索式注入。

8月14日周五
8月13日周四
  1. Hugging Face Blog68

    Hugging Face 用智能体复现 2226 篇 ICML 论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占全部录用论文的 34%。

    推荐理由:Hugging Face 公开了 2200 余篇 ICML 论文的复现结果与判定数据,可据此了解智能体参与科研复现的可行边界。

8月12日周三
  1. Google Research67

    Google Research 发布 AMIE(Video):基于 Gemini 与 Project Astra 的实时视频问诊系统

    Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。

    推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。

8月10日周一
8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard 框架,支持在真实 harness 中训练智能体

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务域复用环境、数据管线和评测流程,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练智能体。

    推荐理由:Orchard 把环境层做成可复用服务,并公开训练数据与评测方法,读者可据此判断开放智能体训练的成本门槛变化。

7月31日周五
7月30日周四