研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
你可能注意到我们 Embed 5 的基准测试看起来有点不同 👀 Embed 5 是首个使用 RCP-nDCG@10 评估的模型族,这是我们最新的方法论,改进了对真实世界检索质量的评估。
传统 nDCG 只认可基准答案库中已有的结果。RCP-nDCG@10 会根据每条结果的实际相关性进行评分,其结果由人工评审和 MTEB 提供支持。
推荐理由:原文给出了排名、净提升幅度与单任务成本的对比,读者可据此权衡新模型的能力增益与代价。
我们为每个基准提供 Router Index 分数,权重为 60% 质量、20% 每任务耗时、20% 成本。 你可以在页面上拖动滑块来更改权重,找到符合你优先级的领先者。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有拟人化头像和可自定义名称,界面与 Meta Muse 类似,可让智能体在虚拟机中操作 Blender、GIMP 等应用,并可通过桌面版 ChatGPT 应用访问用户自己的电脑。
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
GLM 5.3 和 GLM 5.3 Flash 现已在 Cursor 上线! GLM 5.3 Max 是 CursorBench 4.0 上得分最高的开源权重模型。
智能体写应用代码,但出问题时你凌晨 2 点还是得被叫醒。 我们想知道 AI 能否也处理这部分工作。 推出 Incident Arena:一个让编码智能体值班的基准! 查看下方论文与完整数据集发布!
Gemini 4 在 PostTrainBench 上达到 45.3%,是 Gemini 3.1 Pro 21.99% 的两倍多,并超过 GPT-6 Astra 🔥