#评测/基准
#评测/基准
emollick@emollickAI 评分 fchollet@fcholletAI 评分
The Verge · AIAI 评分Instinct 实测:与 Muse、Dots 对比的 AI agent 表现如何
The Verge 作者 Allison Johnson 实测了 AI agent Instinct,并与 Meta 的 Muse、OpenAI 的 Dots 对比。
arena@arenaAI 评分 今天在 @tbpn 收听 @ml_angelopoulos 带来的另一期 Arena Alignment Index 解读
jackmcclelland@jackmcclellandAI 评分 sherwinwu@sherwinwuAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 omarsar0@omarsar0AI 评分 arena@arenaAI 评分
The Verge · AIAI 评分The Verge 影评:讽刺片《Artificial》如何贴近 OpenAI 真实事件
The Verge 发布影评,评述 Luca Guadagnino 执导、Andrew Garfield 主演的 Sam Altman 传记讽刺片《Artificial》在纽约电影节的首映。
SPAC89@SPAC89AI 评分 emollick@emollickAI 评分 少数尝试测量类似能力的基准(METR Long Tasks、GDPval)今年初都已饱和,因为 AI 开始能高质量完成数天的工作。
arena@arenaAI 评分
hq4ai@hq4aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 omarsar0@omarsar0AI 评分 确实。我还想补充一点:如果你知道如何在其之上构建好的评测,你很快就能在你的领域/任务中处于前沿。这就是评测能为你解锁的那种优势。 学会构建好的评测吧。这很值得。
omarsar0@omarsar0AI 评分 omarsar0@omarsar0AI 评分 omarsar0@omarsar0AI 评分 Microsoft ResearchAI 评分 Microsoft Research 播客访谈:AI 评测中的意外失败与应对之道
Microsoft Research 播客中,主持人 Chad Atalla 与 Microsoft 合作研究经理、Purdue 教授 Jennifer Neville 对谈,讨论评测如何推动当今 AI 系统性能边界,以及模型在传统基准之外测试时出现的意外失败。
omarsar0@omarsar0AI 评分 Yuchenj_UW@Yuchenj_UWAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 这是 OpenAI 与 Anthropic 订阅的当前状态。任何 Claude 计划中的 Opus 和 Sonnet 5.5,其每美元价值都远超所有 OpenAI 计划。(5/6)
SemiAnalysis_@SemiAnalysis_AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 arena@arenaAI 评分 arena@arenaAI 评分 Agent Arena 发布跨领域智能体能力排行榜,基于智能体解决全球用户提交的真实任务的 live traces,按相对当前前沿的整体净改进和各任务类别表现排名。
omarsar0@omarsar0AI 评分
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
X:Peter Steinberger (@steipete)AI 评分 OpenAI 在模型版本数量 benchmark 上继续领先
一张按模型版本数量排名的 benchmark 图表显示 OpenAI 继续以明显优势领先,发帖者称这只是一个 benchmark。评论区提到 Anthropic 紧随其后,若发布 Fable 或 Opus 6 将只差 0.1 个版本点,也有人质疑该榜单把同一家模型混排、未对齐推理预算与采样次数。
SemiAnalysis_@SemiAnalysis_AI 评分 X:Ethan Mollick (@emollick)AI 评分 研究称前沿 AI 模型在会计任务上已快于并准于初级会计师
一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。
OpenRouter@OpenRouterAI 评分 路由器并不总是更好。模型切换需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑也会增加延迟。 这些基准测试帮助你找到在所需成本下,对你的工作最高效的路由器和模型组合。
arcprize@arcprizeAI 评分 Lohit Siriki kaggle.com/code/sirikilohit/… linkedin.com/in/lohitsiriki/
X:Rohan Paul (@rohanpaul_ai)精选AI 评分 研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。