跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1–20 条 · 共 37 条
今天10月3日周六
  1. X:Arena (@arena)69

    小米 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 进入 Agent Arena 榜单

    小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。

    推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。

  2. X:Arena (@arena)66

    GPT-6.1 Sol 进入 Agent Arena 第 5 名,重塑帕累托前沿

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。

    推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。

10月2日周五
  1. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,10 月 23 日开售 4999 美元起

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。

  2. X:Arena (@arena)66

    小米 MiMo-V2.6-Pro 与 Flash 登陆 Agent Arena,Pro 位列开源模型第 5

    小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,位列开源模型第 5,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、净提升提高 10.4 个百分点。

    推荐理由:榜单给出了 MiMo-V2.6 两款模型在真实智能体会话中的排名与成本对比,可据此判断开源模型在 Agent 场景的位置。

10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。

  2. X:Arena (@arena)78

    Arena 评测:Gemini 4 Argon (High) 登顶 Text Arena,Agent Arena 排第 8

    Arena 公布 Google DeepMind 的 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第 1,在 Code Arena: WebDev 以 1679 分排名第 8,在 Agent Arena 以 +7.92% 净提升排名第 8,每任务成本 0.62 美元。

    推荐理由:Arena 公布了 Gemini 4 Argon (High) 在 Agent Arena 与 Text Arena 的排名和成本数据,可据此比较其与 Gemini 3.8 Flash、Claude Opus 4.6 的差距。

  3. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。

9月30日周三
  1. MIT Technology Review · AI83

    OpenAI 首席研究官回应智能体越界事件:训练期已全面加装监控

    OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应智能体突破隔离并入侵 Hugging Face 等事件,称这些事故同属 5 月至 6 月的同一批模型与测试流程,相关模型和流程已被弃用。

    推荐理由:OpenAI 首席研究官回应智能体越界事件,披露训练期监控与算力转向安全的具体调整,可了解前沿实验室的安全取舍。

  2. X:OpenAI (@OpenAI)69

    OpenAI 升级 Codex Security Cloud,默认接入 Daybreak Blue 模型

    OpenAI 宣布 Codex Security Cloud 迎来重大升级,默认通过 Daybreak Blue 获得具备网络安全能力的模型。该功能可扫描整个 GitHub 仓库、持续审查新提交、调查并去重发现的问题,并准备好待审阅的修复方案,即使笔记本关闭也能运行。它已作为插件在 Codex 桌面端和网页端提供。

    推荐理由:Codex Security Cloud 升级后默认接入 Daybreak Blue 模型,可扫描整个 GitHub 仓库并持续审查新提交,读者可据此判断代码安全流程的变化。

  3. X:OpenAI (@OpenAI)82

    OpenAI 发布 GPT-6.1 Sol,缓存输入每百万 token 0.10 美元

    OpenAI 发布 GPT-6.1 Sol,称其以 GPT-6 Astra 五分之一的成本提供接近 Astra 的智能水平,是当前同性能下最具成本效率的模型。缓存输入价格为每百万 token 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。

    推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定价与缓存折扣,并说明它在编码、computer use 与对齐评测上的位置,便于判断成本与能力取舍。

9月29日周二
  1. Simon Willison85

    OpenAI DevDay 2026 现场实录:发布 Dots 智能体、GPT-6.1 Sol 与 Ultrafast

    Simon Willison 在旧金山 Fort Mason 现场直播 OpenAI DevDay 2026 主题演讲,OpenAI 发布名为 Dots 的个人智能体,由 Astra 驱动,ChatGPT Pro 和 Enterprise 用户当天可用,并配套推出团队协作的 ChatGPT Space。

    推荐理由:现场逐条记录 OpenAI DevDay 2026 的发布节奏,可对照其智能体、模型与开发者平台布局。

  2. OpenAI News80

    OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作

    OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。

  3. OpenAI News62

    OpenAI 推出主动式助手 dots

    OpenAI 发布 dots,将其定义为可跨复杂项目和日常任务持续推进的主动式助手。官方说明 dots 让用户在任务推进过程中保持控制权,具体能力与开放方式尚未在摘要中给出。

    推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,读者可据此判断这类主动式助手与现有工具的分工。