ARC Prize 分析 Grok 4.7 推理用量与得分
先了解这件事
AI 综述
2026年10月7日,ARC Prize 在 X 上发布分析,探讨 Grok 4.7 的 reasoning token 用量与其 ARC-AGI-2 公开得分之间的关联。报道指出,Grok 4.7 在 low 档每次 test-pair 尝试平均使用约 10k tokens,得分为 25%;而在 medium 至 xhigh 档,平均用量升至 86k 至 120k tokens,得分相应提高到 57.5% 至 60%。ARC Prize 作者认为,low 档较低的 token 用量或可解释其较低的得分。这是目前关于该事件的唯一公开报道内容。
报道时间线
10月7日
- ARC Prize 分析 Grok 4.7 reasoning token 用量与 ARC-AGI-2 得分的关联
ARC Prize 指出 Grok 4.7 的 reasoning token 用量与其 ARC-AGI-2 公开得分相关:low 档每次 test-pair 尝试平均约 10k tokens、得分 25%,medium 至 xhigh 档则为 86k 至 120k tokens、得分 57.5% 至 60%。作者认为 low 档较低的 token 用量或可解释其较低的得分。