微软研究人员提出 CABRA,可生成合成编码任务并每次只提升一种难度,对 8 个 LLM 和 6 个智能体在 6,840 个任务上运行,并将每次工具调用标注为阅读、分析、搜索、编辑或测试。
#评测/基准
#评测/基准
rohanpaul_ai@rohanpaul_aiAI 评分 dair_ai@dair_aiAI 评分
emollick@emollickAI 评分 BenjaminDEKR@BenjaminDEKRAI 评分 _akhaliq@_akhaliqAI 评分 arena@arenaAI 评分 我们的 Alignment Index 来了。 完整技术报告见我们的博客 bit.ly/4hQP3xO,完整排名可自行查看 bit.ly/4hMIHzp
ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 arena@arenaAI 评分 深入阅读我们的博客中的完整技术报告:bit.ly/4hQP3xO,并在我们的 Alignment Index 中查看完整排名:bit.ly/4hMIHzp
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
GitHub Blog · AI & MLAI 评分GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放基准,研究预览版现已上线。
rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2609.36308 Title: "CheatBench: Measuring Reward Gaming in AI Agents"
rohanpaul_ai@rohanpaul_ai精选AI 评分 推荐理由:编辑精选:聚焦智能体评测中的作弊风险,提供了可核对的模型对比和提示词干预结果。数据来自所引 CHEATBENCH 测试,不代表所有任务的通用结论。
X:DAIR.AI (@dair_ai)AI 评分 Meta 提出 Mixture of Self-Improving Branches:分支化智能体 harness 优化
Meta 提出一种分支化的智能体 harness 优化方法,将 Meta-Harness 式单一搜索路径拆成多个分支,每个分支保留自身 harness 更擅长的开发用例、丢弃所有分支已解决的用例,并依据历史重写自己的提议策略,再由 router 在运行前为每个新输入选择某个分支的 harness。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 AgentWorld 论文:多智能体团队不到三分之一的行动真正有助于完成任务
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。
X:Rohan Paul (@rohanpaul_ai)AI 评分 AgentBug-Smith:自动复现智能体系统中的真实 harness bug
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
X:Rohan Paul (@rohanpaul_ai)AI 评分 研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
TechCrunch · AIAI 评分Graphite 研究:Claude Opus 5.5 最爱说“this matters”,各模型写作痕迹各不相同
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
cohere@cohereAI 评分 传统 nDCG 只认可基准答案库中已有的结果。RCP-nDCG@10 会根据每条结果的实际相关性进行评分,其结果由人工评审和 MTEB 提供支持。
The DecoderAI 评分Mercor 研究:AI 在记账任务上速度与准确率超过持证会计师,但仍无法独立完成结账
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
TencentHunyuan@TencentHunyuanAI 评分 Hugging Face BlogAI 评分
Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
CompleteSkeptic@CompleteSkepticAI 评分
OpenAI NewsAI 评分 OpenAI 推出 MentalHealthBench 心理健康评测基准
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。该基准覆盖多种现实心理健康对话场景,从有用性和安全性两个维度衡量模型表现。
Hugging Face Blog精选AI 评分
IBM 研究提出一致性指南,将 ReAct 智能体的 Pass^5 一致性差距从 24.4 点缩小到 12.0 点
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
推荐理由:原文用 Pass^k 与 Mean@k 的差距量化智能体不确定性,并给出可复用的诊断与改进流程。
Hugging Face BlogAI 评分
BenchMIRT:LLM 基准测试究竟在测什么?
Hugging Face 推出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离同一基准中混杂的能力信号。
Hugging Face BlogAI 评分
Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。
Import AIAI 评分Import AI 470:机器不应享有权利;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel
METR 分析发现 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身的算法进展则未见可测加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基线提升 8.1。
Hugging Face Blog精选AI 评分
Hugging Face 研究:语音识别模型存在基准优化问题
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Import AIAI 评分Import AI 469:科学 AI、RSI 模拟器与扎克伯格的技术悲观主义
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款规则与目标均隐藏、需靠探索发现的游戏,其中 21 款已公开。
MSFTResearch@MSFTResearchAI 评分 一条路、一道栅栏、一个结。MindTopo 为测试 AI 对拓扑关系的理解设立了新基准,并揭示了强化空间推理与规划的新机会。msft.it/6011aH02S
Microsoft ResearchAI 评分 MindTopo 揭示多模态大模型的空间推理能力短板
微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。
Google ResearchAI 评分Google Research:前沿 LLM 的事实性瓶颈在召回而非编码
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回,发现 Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34%,即使开启思考也失败 11–12%。
Hugging Face BlogAI 评分
Hugging Face ALTK-Evolve 如何用更少 Token 超越 ACE
Hugging Face 的 ALTK-Evolve 在 AppWorld 上以按需检索指南替代 ACE 的全量 playbook 注入,用更少 Token 取得更高任务完成率。
Import AIAI 评分Import AI 466:机器人领域的苦涩教训、AI 完成周级编程任务与 OpenAI 意外出现的 AI 黑客
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成长周期编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一个 METR 与 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100% 阈值。