X:Peter Steinberger (@steipete)· @PeterJ_Walker·· 5 天前AI 评分
OpenAI 在模型版本数量 benchmark 上继续领先
一张按模型版本数量排名的 benchmark 图表显示 OpenAI 继续以明显优势领先,发帖者称这只是一个 benchmark。评论区提到 Anthropic 紧随其后,若发布 Fable 或 Opus 6 将只差 0.1 个版本点,也有人质疑该榜单把同一家模型混排、未对齐推理预算与采样次数。
当前提供 AI 导读,完整正文请阅读原文。
来源:X:Peter Steinberger (@steipete) · x.com