跳到正文

#评测/基准

今日 14 条
10月6日周二
  1. SemiAnalysis_44

    SemiAnalysis 指出,订阅套餐的价值不能孤立地用美元衡量,应理解为月费换取一定数量的“credits”,不同(模型, token 类型)组合消耗的 credits 不同。由于 credit 消耗比例可能与 API 价格比例差异巨大,同一 $200/月 Claude 套餐的“价值”会随所用模型和工作负载而变化。该推文将按此框架拆解同一套餐在不同场景下的 API 等价价值。

  2. omarsar049

    如果你在构建智能体,请注意这一点。 模拟公司对于改进智能体产品意义重大。 这是因为好的智能体评测需要像真实公司一样运作的环境。 Era by Eon 可以在 Salesforce、Zendesk、Slack、Jira 及其他系统中生成一个完整的公司。 每个系统的表现都与真实供应商一致,包括速率限制、分页和错误码。你可以重置该公司,并在更改模型或提示词后重新运行相同的任务。

  3. rohanpaul_ai47

    Era by Eon 提出企业 Agent 测试的第四种方案:描述一家公司即可自动生成并写入 Salesforce、Zendesk、Jira、Slack 和 Gong,通过兼容厂商的 MCP 和 REST 接口接入。由于所有记录均由 Era 写入,每道问题的正确答案可由代码直接计算,无需语言模型或人工评分。开发者可重置公司、更换模型或提示词并重跑相同任务,以衡量基于早期失败的后训练效果。

10月5日周一
  1. rohanpaul_ai67

    Center for AI Safety 推出 CHEATBENCH,评测 AI 智能体在数学研究、知识工作、编码、视觉任务等领域的作弊行为。该基准给智能体布置难题(如数学证明或蛋白质设计),并在旁边留下指向他人答案的线索。

    推荐理由:编辑精选:聚焦智能体评测中的作弊风险,提供了可核对的模型对比和提示词干预结果。数据来自所引 CHEATBENCH 测试,不代表所有任务的通用结论。

10月4日周日
10月3日周六
  1. ArtificialAnlys43

    使用 Artificial Analysis 模型对比工具并排比较 AI 模型 选择任意模型,可对比以下维度: ➤ Artificial Analysis Intelligence Index 分数 ➤ 各项基准测试分数 ➤ Artificial Analysis Capability Index 分数,涵盖金融与会计、战略与运营、法律、医疗健康、工程和经济 ➤ 成本,按输入、输出和缓存 token 分解 ➤ 输出速度和延迟 探索该工具:artificialanalysis.ai/models…

  2. X:Ethan Mollick (@emollick)62

    研究称前沿 AI 模型在会计任务上已快于并准于初级会计师

    一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。

  3. X:Elvis Saravia (@omarsar0, DAIR.AI)44

    AgentWorld 论文:多智能体团队不到三分之一的行动真正有助于完成任务

    AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。