跳到正文

#评测/基准

今日 0 条
10月7日周三
10月6日周二
9月30日周三
9月23日周三
9月22日周二
9月16日周三
9月2日周三
8月28日周五
  1. Hugging Face Blog36

    Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon

    Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。

8月27日周四
  1. Google DeepMind49

    Google DeepMind 首次试点双重盲测 AI 评估,用密码学环境防止基准污染

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双重盲测评估,将外部评测限制在密码学"黑箱"中,防止模型提前接触测试题造成基准污染。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别模型存在基准优化问题

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。

    推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。

8月12日周三
8月11日周二
7月29日周三
7月15日周三
7月8日周三
7月1日周三
6月30日周二
6月24日周三
6月18日周四
  1. Hugging Face Blog60

    Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在模型 × 版本 × 任务三个维度上测量智能体完成任务所需的轮次、token 和错误率,而非只看最终答案。

    推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动如何在大模型与小模型上产生相反效果。

6月17日周三
5月16日周六
  1. Google DeepMind62

    WeatherNext如何帮助美国国家飓风中心预测飓风Melissa登陆牙买加

    Google DeepMind与Google Research开发的AI气象模型WeatherNext帮助美国国家飓风中心提前五天预测飓风Melissa将以五级强度登陆牙买加,置信度达80%,三天前升至接近100%。

    推荐理由:原文给出WeatherNext在飓风Melissa中的预报表现与NHC验证报告结论,读者可了解AI气象模型在路径与强度预测上的实际作用。

5月6日周三
4月21日周二
  1. Hugging Face Blog34

    QIMMA:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。

4月3日周五
  1. Google Research39

    Google 如何评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。

4月1日周三
3月18日周三
3月17日周二
2月26日周四
2月23日周一
2月19日周四
2月18日周三
2月4日周三
1月27日周二
1月21日周三
12月17日周三
12月16日周二
12月9日周二
12月4日周四