跳到正文
热点事件历史事件

Artificial Analysis 发布编程智能体基准与排行榜

2 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

2026年10月2日,Artificial Analysis 上线 AI 编程智能体基准与排行榜,在软件工程任务上测量编程智能体的真实表现,涵盖成本、token 用量和执行时间,并对比不同智能体与模型之间的性能差异,完整结果可在 artificialanalysis.ai/agents/coding-agents 查看。同日,其 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。目前进展为榜单与指数已公开,三款新模型接近前列,成本差异显著。

AI 根据报道生成 · 2 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. X:Artificial Analysis (@ArtificialAnlys)
    Artificial Analysis 发布 AI 编程智能体基准与排行榜

    Artificial Analysis 上线 AI 编程智能体基准与排行榜,在软件工程任务上测量编程智能体的真实表现,涵盖成本、token 用量和执行时间。该榜单对比不同智能体与模型之间的性能差异,完整结果可在 artificialanalysis.ai/agents/coding-agents 查看。

  2. X:Artificial Analysis (@ArtificialAnlys)精选
    Artificial Analysis 编码智能体指数:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 登顶但成本差异显著

    Artificial Analysis 的 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。