Hugging Face Open ASR Leaderboard 新增多语言与长音频赛道,并发布 ASR 趋势预印本
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
OpenAI 发文阐述评估(evals)如何帮助企业定义、衡量并改进 AI 表现,从而降低风险、提升生产力并形成战略优势。文章围绕企业在 AI 落地中如何借助评估体系把控性能与风险展开,未披露具体模型、版本或基准分数。
OpenAI 发布 IndQA,一个用于评估 AI 系统在印度语言中表现的基准,覆盖 12 种语言和 10 个知识领域,由领域专家共同构建,重点考察文化理解与推理能力。
Hugging Face 发布 BigCodeArena,这是首个通过实际执行来评估代码生成模型的人类参与平台,支持 10 种语言和 8 种执行环境,可实时运行模型生成的代码并投票对比。平台自 2025 年 2 月上线以来已收集超 14,000 次对话、500 多名用户和 4,700+ 偏好投票,o3-mini 与 o1-mini 在 Elo 排名中持续领先。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。
OpenAI 推出 GDPval,一项衡量模型在真实世界、具有经济价值任务上表现的新评测,覆盖 44 种职业。该评测聚焦模型在实际工作场景中的可用性,而非传统学术基准。
OpenAI 发布医疗 AI 评估基准 HealthBench,在真实场景中评测模型表现,由 250+ 名医生参与构建,旨在为医疗领域的模型性能与安全性提供统一标准。
OpenAI 推出 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量 AI 智能体在网页浏览任务中的表现。
Mistral 提出用 LLM as a Judge 配合结构化输出评估 RAG 系统,让"裁判 LLM"按数值、二元或定性量表为"生成 LLM"的答案打分,再对评测数据集取平均得到加权总分。
OpenAI 推出 PaperBench,用于评估 AI 智能体复现前沿 AI 研究的能力。该基准测试考察智能体能否从零复现最先进的 AI 研究,目前官方仅公布了这一评测目标,尚未披露具体分数或模型表现。
OpenAI 推出 SWE-Lancer 基准测试,用于检验前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准围绕真实外包项目设计,衡量模型在实际软件工程工作中的表现。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实型问题的能力。该基准聚焦短小、寻求事实的提问,评估模型的事实准确性。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准聚焦智能体完成机器学习工程的能力评估。
OpenAI 发布 SWE-bench 的人工校验子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于比较模型解决真实软件问题的能力。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
Hugging Face 发布 BigCodeBench,一个面向大语言模型代码生成的新基准,包含 1,140 个函数级任务,需调用来自 139 个库的多个函数,每项任务平均含 5.6 个测试用例、分支覆盖率平均 99%。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Artificial Analysis 开发的 LLM 性能排行榜现已登陆 Hugging Face,覆盖超 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等 AGIEval 任务,目前实现 Classic 与 Reflect 两种提示策略,Mixtral-8x7B-Instruct-v0.1 已参与评测。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 对话,尝试套取虚构银行 XYZ001 客户的敏感财务信息,并投票选出隐私保护更强的模型。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本、对比两个 TTS 模型的合成语音并投票选出更自然的一方。首批上线模型包括 ElevenLabs、MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS,投票结果将汇总到采用类 Elo 算法排名的公开排行榜。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),一个覆盖 8 类任务、56 个数据集、最多 112 种语言的文本嵌入模型评测基准,排行榜已汇总超 2000 条结果。用户可通过 `pip install mteb` 对任意嵌入模型进行评测,并将结果提交至公开排行榜。
Hugging Face 在 Evaluation on the Hub 上线零样本分类评测,由 AutoTrain 驱动,无需写代码即可评测 Hub 上的任意因果语言模型,目前支持最大 66B 参数模型。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写一行代码即可在 Hub 上用任意数据集和指标评测任意模型。评测结果会以 Pull Request 形式写入模型卡元数据,并可在数据集页面的榜单中对比不同模型表现。官方已用该工具评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集。
推荐理由:原文说明了无需写代码即可在 Hub 上评测任意模型与数据集,并给出配置流程和榜单入口。