跳到正文

#评测/基准

今日 2 条
今天10月10日周六
10月9日周五
10月8日周四
10月7日周三
10月6日周二
  1. SemiAnalysis_44

    SemiAnalysis 指出,订阅套餐的价值不能孤立地用美元衡量,应理解为月费换取一定数量的“credits”,不同(模型, token 类型)组合消耗的 credits 不同。由于 credit 消耗比例可能与 API 价格比例差异巨大,同一 $200/月 Claude 套餐的“价值”会随所用模型和工作负载而变化。该推文将按此框架拆解同一套餐在不同场景下的 API 等价价值。

  2. omarsar049

    如果你在构建智能体,请注意这一点。 模拟公司对于改进智能体产品意义重大。 这是因为好的智能体评测需要像真实公司一样运作的环境。 Era by Eon 可以在 Salesforce、Zendesk、Slack、Jira 及其他系统中生成一个完整的公司。 每个系统的表现都与真实供应商一致,包括速率限制、分页和错误码。你可以重置该公司,并在更改模型或提示词后重新运行相同的任务。

10月4日周日
10月3日周六
  1. X:Ethan Mollick (@emollick)62

    研究称前沿 AI 模型在会计任务上已快于并准于初级会计师

    一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。

  2. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。