Artificial Analysis 发布编程智能体基准与排行榜
先了解这件事
AI 综述
2026年10月2日,Artificial Analysis 上线 AI 编程智能体基准与排行榜,在软件工程任务上测量编程智能体的真实表现,涵盖成本、token 用量和执行时间,并对比不同智能体与模型之间的性能差异,完整结果可在 artificialanalysis.ai/agents/coding-agents 查看。同日,其 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。目前进展为榜单与指数已公开,三款新模型接近前列,成本差异显著。
报道时间线
10月2日
- Artificial Analysis 发布 AI 编程智能体基准与排行榜
Artificial Analysis 上线 AI 编程智能体基准与排行榜,在软件工程任务上测量编程智能体的真实表现,涵盖成本、token 用量和执行时间。该榜单对比不同智能体与模型之间的性能差异,完整结果可在 artificialanalysis.ai/agents/coding-agents 查看。
- Artificial Analysis 编码智能体指数:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 登顶但成本差异显著
Artificial Analysis 的 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。