ArtificialAnlys· @ArtificialAnlys · X·· 5 小时前AI 评分
Artificial Analysis:GPT-6 Astra 输出 token 更少但得分高于 Grok 4.7 与 Claude 系列
Artificial Analysis 指出,生成更多输出 token 不一定带来更高得分:GPT-6 Astra (max) 每任务约 81k 输出 token 得分 8.6%,不到 Grok 4.7 (xhigh) 约 180k 输出 token 的一半。三个 Claude 模型每任务输出 token 最多(约 202k 到 562k),得分在 2.8% 到 6.4% 之间。
生成更多的输出 token 并不一定会带来更高的得分。GPT-6 Astra(max)每个任务输出约 8.1 万 token,得分 8.6%,不到 Grok 4.7(xhigh)约 18 万 token 的一半。三个 Claude 模型生成的输出 token 最多(每个任务约 20.2 万到 56.2 万),得分在 2.8% 到 6.4% 之间。
来源:ArtificialAnlys · x.com