跳到正文
灵耀AI热点 LEADERBOARD

AI 模型排行榜

从写代码到改仓库,看模型能不能把软件做出来。

3 项评测·3 家机构·10/03 14:10 更新

共识指数 TOP 12

纵轴从 68 起,只放大差距,不代表 0 分;点柱进详情。

  1. 01Claude Fable 5.1
  2. 02Claude Opus 5
  3. 03GPT-6 Astra
  4. 04Claude Fable 5
  5. 05DeepSeek V4.1 Flash
  6. 06GPT-5.6 Sol
  7. 07Gemini 3.8 Flash
  8. 08GLM-5.3
  9. 09GPT-5.6 Terra
  10. 10Kimi K3
  11. 11Gemini 3.7 Flash
  12. 12GPT-5.5

编程榜的名次来自共同证据,柱高按本榜实际分差等比:名次与分数偶有不同序,属方法本身的取舍。

价格 vs 能力

  • Anthropic
  • OpenAI
  • DeepSeek
  • Google
  • Z.ai
  • Moonshot AI
  • xAI
  • Alibaba
  • Meta

越靠右上越划算(便宜且分高)。横轴对数刻度,右端最便宜;点进模型详情。

越划算 ↗2030405060708090¥10¥100横轴 输出价格 · 人民币 / 百万 Token(对数,右端最便宜)

30 个模型有官方输出价格。价格不参与排名,只用来读这张图;名字放不下时不画标签,悬停或点开仍可看到完整信息。

Claude Fable 5.1(Anthropic)输出 ¥335,共识指数 92.2,第 1 名;Claude Opus 5(Anthropic)输出 ¥168,共识指数 90.1,第 2 名;GPT-6 Astra(OpenAI)输出 ¥335,共识指数 87.8,第 3 名;Claude Fable 5(Anthropic)输出 ¥335,共识指数 87.5,第 4 名;DeepSeek V4.1 Flash(DeepSeek)输出 ¥8.05,共识指数 87.1,第 5 名;GPT-5.6 Sol(OpenAI)输出 ¥134,共识指数 86.7,第 6 名;Gemini 3.8 Flash(Google)输出 ¥25.1,共识指数 86.6,第 7 名;GLM-5.3(Z.ai)输出 ¥29.5,共识指数 82.3,第 8 名;GPT-5.6 Terra(OpenAI)输出 ¥80.5,共识指数 77.1,第 9 名;Kimi K3(Moonshot AI)输出 ¥100,共识指数 76.8,第 10 名;Gemini 3.7 Flash(Google)输出 ¥25.1,共识指数 70.4,第 11 名;GPT-5.5(OpenAI)输出 ¥201,共识指数 70.0,第 12 名;Grok 4.6(xAI)输出 ¥40.2,共识指数 67.8,第 13 名;GLM-5.3 Flash(Z.ai)输出 ¥2.8,共识指数 63.2,第 14 名;Claude Opus 4.8(Anthropic)输出 ¥168,共识指数 59.3,第 15 名;Qwen3.8 Max(Alibaba)输出 ¥36,共识指数 59.2,第 16 名;GPT-5.6 Luna(OpenAI)输出 ¥8.05,共识指数 58.5,第 17 名;Claude Sonnet 5(Anthropic)输出 ¥67,共识指数 55.8,第 18 名;Qwen3.8 27 B(Alibaba)输出 ¥12,共识指数 49.1,第 19 名;Muse Spark 1.1(Meta)输出 ¥28.5,共识指数 45.3,第 20 名;Muse Spark 1.2(Meta)输出 ¥28.5,共识指数 44.9,第 21 名;DeepSeek V4 Pro 0813(DeepSeek)输出 ¥27,共识指数 42.9,第 22 名;DeepSeek V4 Pro Preview(DeepSeek)输出 ¥5.83,共识指数 42.7,第 23 名;Grok 4.5(xAI)输出 ¥40.2,共识指数 40.9,第 24 名;GPT-5.4(OpenAI)输出 ¥101,共识指数 39.8,第 25 名;DeepSeek V4 Flash Preview(DeepSeek)输出 ¥1.88,共识指数 39.3,第 26 名;Gemini 3.6 Flash(Google)输出 ¥25.1,共识指数 37.5,第 27 名;GLM-5.2(Z.ai)输出 ¥28,共识指数 36.5,第 28 名;Gemini 3.5 Flash(Google)输出 ¥60.3,共识指数 27.7,第 29 名;Claude Sonnet 4.6(Anthropic)输出 ¥101,共识指数 20.3,第 30 名

编程榜TOP 30

当前展示 30 个模型,可按列重排;名次来自原榜
模型
01Claude Fable 5.1Anthropic上线 2026-09-01 · 证据敏感评测来源:TapTap Maker、LiveBench · 编程综合缓存输入 ¥1.68输入 ¥67.05 · 输出 ¥335.2392.2
02Claude Opus 5Anthropic上线 2026-07-24 · 较充分评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.6290.1
03GPT-6 AstraOpenAI上线 2026-09-03 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥6.7输入 ¥67.05 · 输出 ¥335.2387.8
04Claude Fable 5Anthropic上线 2026-06-09 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥6.7输入 ¥67.05 · 输出 ¥335.2387.5
05DeepSeek V4.1 FlashDeepSeek上线 2026-09-10 · 证据敏感评测来源:TapTap Maker、LiveBench · 编程综合缓存输入 ¥0.0402输入 ¥2.01 · 输出 ¥8.05官方权重 ↗87.1
06GPT-5.6 SolOpenAI上线 2026-07-09 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥2.68输入 ¥26.82 · 输出 ¥134.0986.7
07Gemini 3.8 FlashGoogle上线 2026-09-02 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.1486.6
08GLM-5.3Z.ai上线 2026-08-18 · 较充分评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥1.74输入 ¥9.39 · 输出 ¥29.5官方权重 ↗82.3
09GPT-5.6 TerraOpenAI上线 2026-07-09 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥80.4677.1
10Kimi K3Moonshot AI上线 2026-07-16 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥2输入 ¥20 · 输出 ¥100官方权重 ↗76.8
11Gemini 3.7 FlashGoogle上线 2026-08-13 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.1470.4
12GPT-5.5OpenAI上线 2026-04-23 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥201.1470.0
13Grok 4.6xAI上线 2026-08-12 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥3.35输入 ¥13.41 · 输出 ¥40.2367.8
14GLM-5.3 FlashZ.ai上线 2026-08-26 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥0.23输入 ¥0.8 · 输出 ¥2.8官方权重 ↗63.2
15Claude Opus 4.8Anthropic上线 2026-05-28 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.6259.3
16Qwen3.8 MaxAlibaba上线 2026-07-19 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 —输入 ¥12 · 输出 ¥3659.2
17GPT-5.6 LunaOpenAI上线 2026-07-09 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥0.13输入 ¥1.34 · 输出 ¥8.0558.5
18Claude Sonnet 5Anthropic上线 2026-06-30 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥67.0555.8
19Qwen3.8 27 BAlibaba上线 2026-08-14 · 证据敏感评测来源:TapTap Maker、LiveBench · 编程综合缓存输入 ¥0.6输入 ¥3 · 输出 ¥12官方权重 ↗49.1
20Muse Spark 1.1Meta上线 2026-07-09 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 —输入 ¥8.38 · 输出 ¥28.4945.3
21Muse Spark 1.2Meta上线 2026-08-05 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 —输入 ¥8.38 · 输出 ¥28.4944.9
22DeepSeek V4 Pro 0813DeepSeek上线 2026-08-13 · 证据敏感评测来源:TapTap Maker、LiveBench · 编程综合缓存输入 ¥0.3输入 ¥9 · 输出 ¥27官方权重 ↗42.9
23DeepSeek V4 Pro PreviewDeepSeek上线 2026-04-24 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥0.0243输入 ¥2.92 · 输出 ¥5.83官方权重 ↗42.7
24Grok 4.5xAI上线 2026-07-08 · 证据敏感评测来源:DeepSWE v1.1、TapTap Maker、LiveBench · 编程综合缓存输入 ¥2.01输入 ¥13.41 · 输出 ¥40.2340.9
25GPT-5.4OpenAI上线 2026-03-05 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥1.68输入 ¥16.76 · 输出 ¥100.5739.8
26DeepSeek V4 Flash PreviewDeepSeek上线 2026-04-24 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥0.0188输入 ¥0.94 · 输出 ¥1.88官方权重 ↗39.3
27Gemini 3.6 FlashGoogle上线 2026-07-21 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.1437.5
28GLM-5.2Z.ai上线 2026-06-16 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥2输入 ¥8 · 输出 ¥28官方权重 ↗36.5
29Gemini 3.5 FlashGoogle上线 2026-05-19 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥1.01输入 ¥10.06 · 输出 ¥60.3427.7
30Claude Sonnet 4.6Anthropic上线 2026-02-17 · 证据敏感评测来源:DeepSWE v1.1、LiveBench · 编程综合缓存输入 ¥2.01输入 ¥20.11 · 输出 ¥100.5720.3

综合榜前十中暂未进入编程榜:Claude Opus 5.5(已有 1 项编程评测)、gpt-6.1-sol(已有 1 项编程评测)、Muse Spark 1.3(已有 1 项编程评测)。分类榜只比较测过同类评测的模型。

按多项公开评测的共同证据排名。每个榜单或筛选结果最多展示 30 个模型,筛选后保留原榜名次与分数。

共识指数不是正确率;同分仍按共同证据确定的名次展示。

如何看这张榜

综合多家公开评测,不同模型的参评覆盖不同。价格不参与排名,缺测不记零分,指数不是正确率。

了解计算方法 →

关于价格

API 价格来自厂商官网,按每百万 Token 展示。美元报价按 2026-10-02 汇率折算成人民币。缓存价格指命中后的输入价格,缓存写入、存储及订阅费用另计。