跳到正文

#评测/基准

今日 14 条
10月3日周六
  1. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

  2. X:Rohan Paul (@rohanpaul_ai)38

    Blackstone 总裁 Jon Gray:会计、法律、金融等规则型业务将被 AI 彻底颠覆

    Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。

  3. X:Rohan Paul (@rohanpaul_ai)44

    研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布

    来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。

10月2日周五
  1. thoughtfullab47

    PostTrainBench v1.2 发布!几项更新: 1. 云端 GPU 支持。你现在可以通过我们新的 Harbor adapter,使用 Harbor + Modal 以相同设置运行基准测试。 2. 新的排行榜冠军。Fable 5.1 以 44.6% 位居第一,其次是 Opus 5.5 的 43.8% 和 GPT-6 (Astra) 的 41.9%。 3. 评测修复。移除了 BFCL,修复了 HumanEval 和 remote-code 评分,增加了跨多个 seed 的平均值,并将污染检查切换为多数投票。

10月1日周四