ArtificialAnlys· @ArtificialAnlys · X·· 1 天前AI 评分
Artificial Analysis:GPT-6 Astra 输出 token 更少但得分高于 Grok 4.7 与 Claude 系列
Artificial Analysis 指出,生成更多输出 token 不一定带来更高得分:GPT-6 Astra (max) 每任务约 81k 输出 token 得分 8.6%,不到 Grok 4.7 (xhigh) 约 180k 输出 token 的一半。三个 Claude 模型每任务输出 token 最多(约 202k 到 562k),得分在 2.8% 到 6.4% 之间。
Generating more output tokens doesn’t necessarily translate to a higher score. GPT-6 Astra (max) scores 8.6% on ~81k output tokens per task, under half the ~180k of Grok 4.7 (xhigh). Three Claude models generated the most output tokens (~202k to ~562k per task) and score 2.8% to 6.4%.
来源:ArtificialAnlys · x.com