跳到正文

#评测/基准

今日 30 条
今天10月3日周六
  1. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

  2. X:Rohan Paul (@rohanpaul_ai)38

    Blackstone 总裁 Jon Gray:会计、法律、金融等规则型业务将被 AI 彻底颠覆

    Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。

  3. X:Cohere(@cohere)22

    Cohere 用 RCP-nDCG@10 评估 Embed 5,改进真实检索质量评测

    Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法不再只认可基准答案键中已有的结果,而是对每条结果按实际相关性打分。Cohere 称 RCP-nDCG@10 的结果由人工评审和 MTEB 背书,并将于 10 月 8 日(周四)在 X Live 举办网络研讨会,讨论 RCP-nDCG@10、Embed 5 以及搜索与检索的未来。

  4. X:Karina Nguyen(@karinanguyen)41

    Repovive 数学竞赛 AI 判卷评测:GPT 与 Claude 模型评判数学证明的能力对比

    Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。

  5. X:Arena (@arena)66

    GPT-6.1 Sol 进入 Agent Arena 第 5 名,重塑帕累托前沿

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。

    推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。

10月2日周五
  1. X:ARC Prize (@arcprize)42

    ARC Prize 回应 Qwen3.8-27B 榜单成本估算方式,ARC-AGI-3 结果待测试完成

    ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。

10月1日周四
  1. X:Arena (@arena)67

    Gemini 4 Argon 与前沿模型对比:单任务成本比 GPT-6.1 Sol 低 33%

    Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。

    推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。

  2. X:Karina Nguyen(@karinanguyen)66

    Google 预告 Gemini 4 Argon,PostTrainBench 得分 45.3%

    Google 放出 Gemini 4 Argon 的早期预览,称其在复杂工作流、网络防御和软件工程上展现前沿性能,Google 内部团队已从编码到量子计算广泛使用。在 PostTrainBench 上,Gemini 4 达到 45.3%,高于 Gemini 3.1 Pro 的 21.99%。作者表示这是朝构建能负责任自我改进的 AI 迈出的一步,并附上了基准测试结果。