GPT-6 Astra 输出更少但得分更高
先了解这件事
AI 综述
2026年10月9日,评测机构 Artificial Analysis 在 X 上发布对比数据,指出生成更多输出 token 不一定带来更高得分。其数据显示,GPT-6 Astra (max) 每任务约 81k 输出 token,得分 8.6%;Grok 4.7 (xhigh) 每任务约 180k 输出 token,得分低于 GPT-6 Astra;三个 Claude 模型每任务输出 token 最多,约 202k 到 562k,得分在 2.8% 到 6.4% 之间。
报道时间线
10月9日
- Artificial Analysis:GPT-6 Astra 输出 token 更少但得分高于 Grok 4.7 与 Claude 系列
Artificial Analysis 指出,生成更多输出 token 不一定带来更高得分:GPT-6 Astra (max) 每任务约 81k 输出 token 得分 8.6%,不到 Grok 4.7 (xhigh) 约 180k 输出 token 的一半。三个 Claude 模型每任务输出 token 最多(约 202k 到 562k),得分在 2.8% 到 6.4% 之间。