Agent Arena 发布跨领域智能体能力排行榜
Agent Arena 发布跨领域智能体能力排行榜,基于智能体解决全球用户提交的真实任务的 live traces,按相对当前前沿的整体净改进和各任务类别表现排名。
Agent Arena 对智能体在各领域解决问题的能力进行排名。
美国实验室在每个领域均处于领先地位:
- @AnthropicAI 的模型在 Code、Work 和 Chat 三个领域均位居第一
- @OpenAI 的 GPT 6 Astra (Max) 在所有三个类别中均保持前四:Code 排名第二,Work 和 Chat 均排名第四
领先模型在各类别中均表现强劲,但排名有所变化:
- Claude Fable 5.1 (Max) 在 Code 和 Work 中均排名第一,在 Chat 中排名第二
- Claude Sonnet 5.5 (Max) 在 Chat 中排名第一,在 Code 中排名第四,在 Work 中排名第五
Code 和 Work 的排名变化比 Chat 更为同步:
- 例如,Gemini 4 Argon (High) 在 Code 中排名第 14,在 Work 中排名第 12,但在 Chat 中排名第 5,凸显了其在对话式智能体任务方面的独特优势
Agent Arena 根据模型相对于当前前沿的整体净提升,以及在特定类别智能体任务中的表现进行排名。这些排名基于实时追踪数据,数据来源于智能体尝试解决由全球人类提交的真实任务的过程。
- Code:编写和调试代码、工作流自动化和数据分析
- Chat:创意写作、学习、个人问题、日常研究和媒体生成
- Work:文档、专业研究、规划和专业写作
此图表展示了截至 2026 年 10 月 5 日,所选模型在 Agent Arena 各类别中的对比情况。
来源:arena · x.com