ARC Prize公布Qwen3.8-27B成绩
先了解这件事
2026年10月2日,ARC Prize官方公布Qwen3.8-27B在ARC-AGI基准上的成绩:ARC-AGI v2得分为42.4%,每题成本$0.45;ARC-AGI v1得分为87.5%,每题成本$0.22。ARC Prize指出,榜单成本是按阿里云挂牌token价格乘以记录的token用量估算,并非其专用推理费用。作者还提到,Qwen的chat template为low和xhigh推理档位提供了引导,但缺少medium档位的引导,这可能解释了medium档位消耗更多token却得分低于low档位的现象。ARC Prize同时公开了排行榜、复现结果的GitHub仓库、测试政策及Qwen3.8-27B完整结果页面,并表示测试完成后将分享ARC-AGI-3结果。
事件进展
报道时间线
- ARC Prize 公布 Qwen3.8-27B 完整结果
- 排行榜:arcprize.org/leaderboard - 复现公开结果:github.com/arcprize/arc-agi-… - 测试政策:arcprize.org/policy - Qwen3.8-27B 完整结果:arcprize.org/results/alibaba…
- ARC Prize 榜单成本按阿里云 token 价估算
榜单成本是通过将 Alibaba Cloud 的挂牌 token 价格应用于记录的 token 使用量来估算的,而非使用我们的专用推理费用。 测试完成后,我们将分享 ARC-AGI-3 结果。 完整结果:arcprize.org/results/alibaba…
- ARC Prize 测评 Qwen3.8-27B 在 ARC-AGI 上的成绩与推理档位差异
ARC Prize 公布 Qwen3.8-27B 在 ARC-AGI (Verified) 上的成绩:ARC-AGI v2 为 42.4%,$0.45/task;ARC-AGI v1 为 87.5%,$0.22/task。作者指出 Qwen 的 chat template 为 low 和 xhigh 推理档位提供了引导,但没有 medium,这可能解释了 medium 消耗更多 token 却得分低于 low 的现象。