#评测/基准
#评测/基准
ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ElevenLabs 的 Eleven v4 Turbo 在 Artificial Analysis Provider Voice TTS Arena 榜单上以 Elo 1。
SemiAnalysis_@SemiAnalysis_AI 评分 这是 OpenAI 与 Anthropic 订阅的当前状态。任何 Claude 计划中的 Opus 和 Sonnet 5.5,其每美元价值都远超所有 OpenAI 计划。(5/6)
SemiAnalysis_@SemiAnalysis_AI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 arena@arenaAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 Agent Arena 发布跨领域智能体能力排行榜,基于智能体解决全球用户提交的真实任务的 live traces,按相对当前前沿的整体净改进和各任务类别表现排名。
Simon WillisonAI 评分 Qwen3.8 27B 本地模型英文单词加法评测:关闭推理准确率 23.57%,开启后 169 次答对 167 次
Simon Willison 在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 复现了 Colin Frasier 两年前用 GPT-4o 做的加法实验,让模型把正整数相加并仅用英文单词给出精确结果。
GitHub Blog · AI & MLAI 评分GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放基准,研究预览版现已上线。
omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
elonmusk@elonmuskAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2609.36308 Title: "CheatBench: Measuring Reward Gaming in AI Agents"
rohanpaul_ai@rohanpaul_ai精选AI 评分 推荐理由:编辑精选:聚焦智能体评测中的作弊风险,提供了可核对的模型对比和提示词干预结果。数据来自所引 CHEATBENCH 测试,不代表所有任务的通用结论。
dair_ai@dair_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 cohere@cohereAI 评分 基准测试:我们使用了 WMT26 基准,它是在我们创建模型之后发布的,确保我们无法针对其测量结果来训练 North Small Translate。(5/6)
X:Peter Steinberger (@steipete)AI 评分 OpenAI 在模型版本数量 benchmark 上继续领先
一张按模型版本数量排名的 benchmark 图表显示 OpenAI 继续以明显优势领先,发帖者称这只是一个 benchmark。评论区提到 Anthropic 紧随其后,若发布 Fable 或 Opus 6 将只差 0.1 个版本点,也有人质疑该榜单把同一家模型混排、未对齐推理预算与采样次数。
ArtificialAnlys@ArtificialAnlysAI 评分 完整结果: artificialanalysis.ai/speech… artificialanalysis.ai/speech… 方法论: artificialanalysis.ai/speech…
ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 Artificial Analysis 为 Coding Agent Index 新增两项安全拒绝报告视图:拒绝时机(任务提示词即触发还是智能体开始工作后触发)与回退模型(拒绝后切换到哪个模型)。
ArtificialAnlys@ArtificialAnlysAI 评分 Artificial Analysis 评测显示,Qwen-Image-2.1 最强的图像编辑用例为生产力与知识工作、零售与电商、动画与游戏,其中生产力与知识工作最接近领先者。
ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 X:DAIR.AI (@dair_ai)AI 评分 Meta 提出 Mixture of Self-Improving Branches:分支化智能体 harness 优化
Meta 提出一种分支化的智能体 harness 优化方法,将 Meta-Harness 式单一搜索路径拆成多个分支,每个分支保留自身 harness 更擅长的开发用例、丢弃所有分支已解决的用例,并依据历史重写自己的提议策略,再由 router 在运行前为每个新输入选择某个分支的 harness。
SemiAnalysis_@SemiAnalysis_AI 评分 X:Ethan Mollick (@emollick)AI 评分 研究称前沿 AI 模型在会计任务上已快于并准于初级会计师
一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 AgentWorld 论文:多智能体团队不到三分之一的行动真正有助于完成任务
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。
Latent SpaceAI 评分AINews:GPT-6.1 Sol 与 Sonnet 5.5 重塑性价比前沿
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 GPT-6 Sol 便宜 39% 且 Agent Arena 得分高 1.52 分,比 Astra 便宜 81%。
OpenRouter@OpenRouterAI 评分 OpenRouter@OpenRouterAI 评分 路由器并不总是更好。模型切换需要重建输入缓存,任务复杂度难以从提示词判断,选择逻辑也会增加延迟。 这些基准测试帮助你找到在所需成本下,对你的工作最高效的路由器和模型组合。
arcprize@arcprizeAI 评分 Lohit Siriki kaggle.com/code/sirikilohit/… linkedin.com/in/lohitsiriki/
arcprize@arcprizeAI 评分 Lord Han Solo kaggle.com/lordhansolo Notebook: kaggle.com/code/lordhansolo/…
arcprize@arcprizeAI 评分