跳到正文
灵耀AI热点 LEADERBOARD

AI 模型排行榜

汇集多种能力的真实评测,找到综合表现更强的模型。

18 项评测·7 家机构·10/03 14:10 更新

共识指数 TOP 12

纵轴从 73 起,只放大差距,不代表 0 分;点柱进详情。

  1. 01Claude Opus 5.5
  2. 02GPT-6 Astra
  3. 03Claude Fable 5.1
  4. 04Claude Fable 5
  5. 05gpt-6.1-sol
  6. 06Claude Opus 5
  7. 07Muse Spark 1.3
  8. 08Gemini 3.7 Flash
  9. 09Gemini 3.8 Flash
  10. 10GPT-5.6 Sol
  11. 11claude-sonnet-5.5
  12. 12GPT-5.5

综合榜的名次来自共同证据,柱高按本榜实际分差等比:名次与分数偶有不同序,属方法本身的取舍。

价格 vs 能力

  • Anthropic
  • OpenAI
  • Meta
  • Google
  • Moonshot AI
  • Alibaba
  • Z.ai
  • DeepSeek

越靠右上越划算(便宜且分高)。横轴对数刻度,右端最便宜;点进模型详情。

越划算 ↗50607080¥10¥100横轴 输出价格 · 人民币 / 百万 Token(对数,右端最便宜)

27 个模型有官方输出价格,另有 3 个未核验价格未进图(gpt-6.1-sol、claude-sonnet-5.5、Gemini 3 Pro Preview)。价格不参与排名,只用来读这张图;名字放不下时不画标签,悬停或点开仍可看到完整信息。

Claude Opus 5.5(Anthropic)输出 ¥134,共识指数 83.0,第 1 名;GPT-6 Astra(OpenAI)输出 ¥335,共识指数 82.9,第 2 名;Claude Fable 5.1(Anthropic)输出 ¥335,共识指数 82.6,第 3 名;Claude Fable 5(Anthropic)输出 ¥335,共识指数 82.3,第 4 名;Claude Opus 5(Anthropic)输出 ¥168,共识指数 81.0,第 6 名;Muse Spark 1.3(Meta)输出 ¥28.5,共识指数 77.9,第 7 名;Gemini 3.7 Flash(Google)输出 ¥25.1,共识指数 77.7,第 8 名;Gemini 3.8 Flash(Google)输出 ¥25.1,共识指数 77.4,第 9 名;GPT-5.6 Sol(OpenAI)输出 ¥134,共识指数 77.1,第 10 名;GPT-5.5(OpenAI)输出 ¥201,共识指数 74.6,第 12 名;GPT-6 Sol(OpenAI)输出 ¥67,共识指数 73.6,第 13 名;Kimi K3(Moonshot AI)输出 ¥100,共识指数 72.2,第 14 名;Qwen3.8 Max(Alibaba)输出 ¥36,共识指数 72.1,第 15 名;Claude Opus 4.7(Anthropic)输出 ¥168,共识指数 71.3,第 16 名;Muse Spark 1.2(Meta)输出 ¥28.5,共识指数 69.5,第 17 名;Claude Opus 4.8(Anthropic)输出 ¥168,共识指数 68.6,第 18 名;Qwen3.8 Max 0902(Alibaba)输出 ¥36,共识指数 68.2,第 19 名;GLM-5.3(Z.ai)输出 ¥29.5,共识指数 67.0,第 20 名;Claude Opus 4.6(Anthropic)输出 ¥168,共识指数 66.3,第 21 名;Muse Spark 1.1(Meta)输出 ¥28.5,共识指数 62.6,第 22 名;GPT-5.4(OpenAI)输出 ¥101,共识指数 61.0,第 24 名;Gemini 3.6 Flash(Google)输出 ¥25.1,共识指数 60.1,第 25 名;DeepSeek V4.1 Flash(DeepSeek)输出 ¥8.05,共识指数 59.5,第 26 名;GPT-5.6 Terra(OpenAI)输出 ¥80.5,共识指数 58.9,第 27 名;Gemini 3.1 Pro Preview(Google)输出 ¥80.5,共识指数 57.7,第 28 名;Gemini 3.5 Flash(Google)输出 ¥60.3,共识指数 56.0,第 29 名;Gemini 3 Flash Preview(Google)输出 ¥20.1,共识指数 51.1,第 30 名

综合榜TOP 30

当前展示 30 个模型,可按列重排;名次来自原榜
模型
01Claude Opus 5.5Anthropic上线 2026-09-17 · 持续积累评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1缓存输入 ¥1.34输入 ¥26.82 · 输出 ¥134.0983.0
02GPT-6 AstraOpenAI上线 2026-09-03 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥6.7输入 ¥67.05 · 输出 ¥335.2382.9
03Claude Fable 5.1Anthropic上线 2026-09-01 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、APEX-Agents 1.1、Arena Vision缓存输入 ¥1.68输入 ¥67.05 · 输出 ¥335.2382.6
04Claude Fable 5Anthropic上线 2026-06-09 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥6.7输入 ¥67.05 · 输出 ¥335.2382.3
05gpt-6.1-solopenai上线 — · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 —输入 — · 输出 —82.3
06Claude Opus 5Anthropic上线 2026-07-24 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.6281.0
07Muse Spark 1.3Meta上线 2026-09-02 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、APEX-Agents 1.1、Arena Vision缓存输入 —输入 ¥8.38 · 输出 ¥28.4977.9
08Gemini 3.7 FlashGoogle上线 2026-08-13 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.1477.7
09Gemini 3.8 FlashGoogle上线 2026-09-02 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.1477.4
10GPT-5.6 SolOpenAI上线 2026-07-09 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥2.68输入 ¥26.82 · 输出 ¥134.0977.1
11claude-sonnet-5.5anthropic上线 — · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 —输入 — · 输出 —74.8
12GPT-5.5OpenAI上线 2026-04-23 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥201.1474.6
13GPT-6 SolOpenAI上线 2026-09-22 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥67.0573.6
14Kimi K3Moonshot AI上线 2026-07-16 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1缓存输入 ¥2输入 ¥20 · 输出 ¥100官方权重 ↗72.2
15Qwen3.8 MaxAlibaba上线 2026-07-19 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 —输入 ¥12 · 输出 ¥3672.1
16Claude Opus 4.7Anthropic上线 2026-04-16 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.6271.3
17Muse Spark 1.2Meta上线 2026-08-05 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、SimpleQA Verified、APEX-Agents 1.1、Arena Vision缓存输入 —输入 ¥8.38 · 输出 ¥28.4969.5
18Claude Opus 4.8Anthropic上线 2026-05-28 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.6268.6
19Qwen3.8 Max 0902Alibaba上线 2026-09-01 · 证据敏感评测来源:Arena WebDev、TapTap Maker、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、SimpleQA Verified、GPQA Diamond缓存输入 —输入 ¥12 · 输出 ¥3668.2
20GLM-5.3Z.ai上线 2026-08-18 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1缓存输入 ¥1.74输入 ¥9.39 · 输出 ¥29.5官方权重 ↗67.0
21Claude Opus 4.6Anthropic上线 2026-02-05 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.6266.3
22Muse Spark 1.1Meta上线 2026-07-09 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、SimpleQA Verified、APEX-Agents 1.1、Arena Vision缓存输入 —输入 ¥8.38 · 输出 ¥28.4962.6
23Gemini 3 Pro PreviewGoogle上线 2025-11-18 · 证据敏感评测来源:Arena Text、Arena WebDev、Arena 创作盲选、Creative Writing v3、Longform Writing、Chess Puzzles、GPQA Diamond、Arena Vision缓存输入 —输入 — · 输出 —62.1
24GPT-5.4OpenAI上线 2026-03-05 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、APEX-Agents 1.1、Arena Vision缓存输入 ¥1.68输入 ¥16.76 · 输出 ¥100.5761.0
25Gemini 3.6 FlashGoogle上线 2026-07-21 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.1460.1
26DeepSeek V4.1 FlashDeepSeek上线 2026-09-10 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、APEX-Agents 1.1缓存输入 ¥0.0402输入 ¥2.01 · 输出 ¥8.05官方权重 ↗59.5
27GPT-5.6 TerraOpenAI上线 2026-07-09 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥80.4658.9
28Gemini 3.1 Pro PreviewGoogle上线 2026-02-19 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Creative Writing v3、Longform Writing、DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥80.4657.7
29Gemini 3.5 FlashGoogle上线 2026-05-19 · 证据敏感评测来源:Arena Text、Arena WebDev、LiveBench · 语言与指令、Arena 创作盲选、Longform Writing、DeepSWE v1.1、LiveBench · 编程综合、LiveBench · 推理与数学、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、APEX-Agents 1.1、Arena Vision缓存输入 ¥1.01输入 ¥10.06 · 输出 ¥60.3456.0
30Gemini 3 Flash PreviewGoogle上线 2025-12-17 · 证据敏感评测来源:Arena Text、Arena WebDev、Arena 创作盲选、Longform Writing、FrontierMath v2 · Tiers 1–3、FrontierMath v2 · Tier 4、Chess Puzzles、Mystery Game Puzzles、SimpleQA Verified、GPQA Diamond、Arena Vision缓存输入 ¥0.34输入 ¥3.35 · 输出 ¥20.1151.1

按多项公开评测的共同证据排名。每个榜单或筛选结果最多展示 30 个模型,筛选后保留原榜名次与分数。

共识指数不是正确率;同分仍按共同证据确定的名次展示。

如何看这张榜

综合多家公开评测,不同模型的参评覆盖不同。价格不参与排名,缺测不记零分,指数不是正确率。

了解计算方法 →

关于价格

API 价格来自厂商官网,按每百万 Token 展示。美元报价按 2026-10-02 汇率折算成人民币。缓存价格指命中后的输入价格,缓存写入、存储及订阅费用另计。