X 用户讨论 Artificial Analysis 成本图表为何使用对数刻度
X 上一段动画直观演示了 Artificial Analysis 成本图表为何采用对数刻度——Cost per Task 的 X 轴覆盖 1000x 的价格区间,线性刻度无法呈现。评论区还对比了性价比:Muse Glimmer 约 340 分/$1,Claude Opus 5.5 约 16 分/$1,Claude Fable 5.1 约 9.5 分/$1,但高分模型解锁的能力不可替代。
哦,原来他们用对数刻度是因为这个!
![]()
2026年10月3日 · UTC 时间晚上8:19
16
43
1,986 162,657
2
3
3,228
没错,而且只盯着 Max 看会让它显得很糟。他们的 Max 大概比 xhigh 贵 2-3 倍。
2
2,335
动画真棒!这就是这张图表如此重要的原因——X 轴展示的是每任务成本上 1000 倍的差距。 也许我们应该在主页上加个按钮来展示这个!
1
3
414
你当然可以,但说实话那样图表就有点没法看了 话说回来,我超爱 Artificial Analysis。 我在想你能不能看看我的副项目 mypriors.com,它有点像 Artificial Analysis,但你可以自定义它展示的所有基准测试,以及你使用的组合。所以如果你不同意排名,你可以自己改。 非常希望能得到你的任何反馈!
262
智能/美元的收益递减非常严重 Muse Glimmer ∼17 / $0.05 = 每 $1 约 340 分 Claude Opus 5.5 ∼56 / $3.5 = 每 $1 约 16 分 Claude Fable 5.1 ∼57 / $6 = 每 $1 约 9.5 分 但最后那几个智能点数决定了‘能不能搞定’,所以还是值得花钱的
3
4
3,291
不过每美元得分其实并不是个好指标,因为这些分数并不能真正互换。一个得分在 50 多的模型,其智能水平和 Muse Glimmer 完全不在一个档次。 在现实世界中,如果它的表现是 Muse Glimmer 的三倍,它能给你带来的用处并不只是三倍。那是一种完全不同的能力,能解锁 Muse Glimmer 永远做不到的事情,无论你给它投入多少 token。 更不用说可靠性带来的价值了。这意味着你不必盯着一条线程确保它没干蠢事,而是可以同时发出很多条线程,其中一些你甚至都不用检查,因为你可以相信它们会交付你指定的结果。
7
1,382
这是我第一次在 X 上真的学到了东西
1
13
2,497
很高兴能帮上忙 🫡
3
2,162
有意思,成本是对数刻度,但推理得分却不是。
1
3
1,213
对数刻度的价值在于,当你的数据跨越了多个数量级,用线性刻度展示会不切实际时。而能力得分并没有这种情况。 智能分数目前基本在 10 到 60 之间,连一个数量级都不到。用对数刻度就有点可笑了。
3
1,002
敲敲牌子:
我敢说,这才是这张图表的正确版本。
1
230
即使考虑到人们为据称能从中获得的竞争优势买单,也还没有任何一件用 Anthropic 模型做出来或完成的事情是配得上那个更高价格的。
299
老兄,如果你在数学课上就放这个简单的动画来解释对数,你连班里智商最低的那个都能一下子教会……真是个绝佳的可视化方式 👌
1
62
3,506
对数刻度的意义在于展示重要的比例关系。在线性刻度下,每 mTok 0.001 和 0.01 的差异是难以察觉的,但实际使用成本却是有差别的。你用一个小间隔反而夸大了差异
ALT 一个更合理的 token 成本刻度,不过对数刻度更有意义
ALT 一个荒谬、不切实际的刻度,用来演示 token 成本
1
13
2,207
最具误导性的刻度!
2
1,629
这真是展示对数刻度的一种超酷、超直观的方式。
19
2,769
这是暴力。
1
1,503
人们正在了解缩放定律
83
Claude 模型订阅很便宜,但 API 很贵。嗯,也不算太贵,但自从 5.5 版本发布后还算能用。
1
421
我靠
3
1,059
噢噢噢噢
1
65
来源:X:Peter Steinberger (@steipete) · x.com


















