OpenRouter 上线 Model Router Benchmarks,7 个路由同台对比质量、速度与成本
OpenRouter 推出 Model Router Benchmarks,可在 6 项基准上并排比较 7 个路由的质量、速度与成本,现已开放使用,包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
OpenRouter 推出 Model Router Benchmarks,可在 6 项基准上并排比较 7 个路由的质量、速度与成本,现已开放使用,包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
OpenRouter 发布 Model Router Benchmarks,在 6 个基准上从质量、速度、成本三个维度对比 7 个模型路由,包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
ARC Prize 公布 2026 年 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 2.5 万美元,Lord Han Solo 以 23.8% 获 7500 美元,Lohit Siriki 以 22.5% 获 5000 美元。
ARC Prize 2026 公布 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的方案。Daniel Franzen 以 27.9% 得分获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
ARC Prize 2026 公布 ARC-AGI-3 里程碑 #2 的三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
Blackstone 总裁兼 COO Jon Gray 此前已提出,会计、法律、金融等规则型业务将被 AI 彻底颠覆,JPMorgan 已用 AI 取代代理顾问处理股东投票。一则对比显示,Claude Opus 5 在 20 项任务中全部以 100% 正确率完成且每项仅需数分钟,而 12 名持证 CPA 的正确率从 0% 到约 90% 不等,多人耗尽 3 小时时限。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
美中多家实验室的论文提出 AgentBug-Smith,把 GitHub 上智能体框架的真实 bug 报告自动转成可运行测试,形成一套 200 个 bug 且持续增长的基准。
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评测的模型系列,这是其最新评测方法,旨在改进对真实检索质量的评估。该系列基准测试结果因此呈现不同面貌。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法用于改进真实场景检索质量评估。传统 nDCG 只计算已在基准答案集中的结果,RCP-nDCG@10 则按每条结果的实际相关性打分,结果由人工评审和 MTEB 支撑。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法不再只认可基准答案键中已有的结果,而是对每条结果按实际相关性打分。Cohere 称 RCP-nDCG@10 的结果由人工评审和 MTEB 背书,并将于 10 月 8 日(周四)在 X Live 举办网络研讨会,讨论 RCP-nDCG@10、Embed 5 以及搜索与检索的未来。
Claude Sonnet 5.5 的 xHigh 推理档位进入 Code Arena WebDev 榜单,以 1786 分排名第 3,混合价格 $8/M tokens,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分,价格约为其 80%。
Claude Sonnet 5.5 以 xHigh 推理模式进入 Code Arena: WebDev,得分 1786 分排名第 3,混合价格 $8/M tokens。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 公布 Claude Sonnet 5.5(Max)首次进入 Agent Arena 即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点;在 Chat 分类中以 +15.6% 位列第 1,高于 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Anthropic 的 Claude Sonnet 5.5(Max)在 Agent Arena 首次上榜即位列第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点。
Ideogram 4.5 在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上位列第 23,是 Ideogram 首个进入该编辑榜的模型,同时在 AA-Image-T2I v2.0 上排名第 34,较 Ideogram 4.0 的第 40 名有所上升。
Ideogram 4.5 于 9 月 30 日发布,在 AA-Image-Editing v2.0 排名第 23(Ideogram 首个上榜的编辑模型),在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 名上升。
Ideogram 4.5 于 9 月 30 日发布,在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上排名第 23,是 Ideogram 首个登上该图像编辑榜的模型,在 AA-Image-T2I v2.0 上从 Ideogram 4.0 的第 40 名升至第 34 名。
OpenRouter 推出 Model Router Benchmarks,在 6 项基准上从质量、速度、成本三个维度横向对比 7 款模型路由器,涵盖 Unbiased Pareto、Sakana Fugu、Auto Router、Jev Router、NVIDIA Switchyard 等,并纳入领先单体模型作为对照。
OpenRouter 推出 Model Router Benchmarks,在 6 项基准上从质量、速度、成本三个维度对比 7 个模型路由,涵盖 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
OpenRouter 上线 Model Router Benchmarks,可并排对比 7 款模型路由器在 6 项基准上的质量、速度和成本表现。参与对比的路由器包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等,现已开放使用。
Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有拟人化头像和可自定义名称,界面与 Meta Muse 类似,可让智能体在虚拟机中操作 Blender、GIMP 等应用,并可通过桌面版 ChatGPT 应用访问用户自己的电脑。
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
Cursor 宣布 GLM 5.3 和 GLM 5.3 Flash 已在其平台上线。其中 GLM 5.3 Max 在 CursorBench 4.0 上是得分最高的开源权重模型。
ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。
ARC Prize 公布了 Qwen3.8-27B 在 ARC-AGI 上的完整测试结果,并同步给出排行榜、公开结果复现方式与测试政策。相关结果可在 ARC Prize 排行榜查看,复现脚本托管于 arcprize/arc-agi-benchmarking 仓库。
ARC Prize 公布 Qwen3.8-27B 在 ARC-AGI(Verified)上的测试结果:ARC-AGI v2 得分 42.4%、每任务 0.45 美元,ARC-AGI v1 得分 87.5%、每任务 0.22 美元。
PostTrainBench v1.2 发布,新增云 GPU 支持,可通过 Harbor adapter 在 Harbor + Modal 上以相同设置运行基准测试。
Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。
推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。
HiDream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 排名第 7,距 gemini-omni-flash 差 8 分,与 dreamina-seedance-2.0 和 2.5 的差距在 20 分以内。
HiDream 的 HiDream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 第 7 名,距 gemini-omni-flash 仅差 8 分,与 dreamina-seedance-2.0 和 2.5 的差距在 20 分以内。
Google 放出 Gemini 4 Argon 的早期预览,称其在复杂工作流、网络防御和软件工程上展现前沿性能,Google 内部团队已从编码到量子计算广泛使用。在 PostTrainBench 上,Gemini 4 达到 45.3%,高于 Gemini 3.1 Pro 的 21.99%。作者表示这是朝构建能负责任自我改进的 AI 迈出的一步,并附上了基准测试结果。