跳到正文
原文
arcprize· @arcprize · X·· 7 小时前AI 评分58

ARC Prize 分析 Grok 4.7 reasoning token 用量与 ARC-AGI-2 得分的关联

AI 导读

ARC Prize 指出 Grok 4.7 的 reasoning token 用量与其 ARC-AGI-2 公开得分相关:low 档每次 test-pair 尝试平均约 10k tokens、得分 25%,medium 至 xhigh 档则为 86k 至 120k tokens、得分 57.5% 至 60%。作者认为 low 档较低的 token 用量或可解释其较低的得分。

正文 · AI 翻译

Grok 4.7 的推理 token 用量与其 ARC-AGI-2 公开得分相关:低(low)档平均每对测试题尝试消耗 1 万 token,得分 25%;而中(medium)到超高(xhigh)档消耗 8.6 万至 12 万 token,得分 57.5% 至 60%。低档较低的 token 用量或许可以部分解释其较低的得分。

来源:arcprize · x.com