跳到正文

#评测/基准

今日 18 条
7月6日周一
7月1日周三
6月30日周二
6月24日周三
6月18日周四
  1. Hugging Face Blog60

    Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在模型 × 版本 × 任务三个维度上测量智能体完成任务所需的轮次、token 和错误率,而非只看最终答案。

    推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动如何在大模型与小模型上产生相反效果。

6月17日周三
6月15日周一
5月16日周六
  1. Google DeepMind62

    WeatherNext如何帮助美国国家飓风中心预测飓风Melissa登陆牙买加

    Google DeepMind与Google Research开发的AI气象模型WeatherNext帮助美国国家飓风中心提前五天预测飓风Melissa将以五级强度登陆牙买加,置信度达80%,三天前升至接近100%。

    推荐理由:原文给出WeatherNext在飓风Melissa中的预报表现与NHC验证报告结论,读者可了解AI气象模型在路径与强度预测上的实际作用。

5月6日周三
4月21日周二
  1. Hugging Face Blog34

    QIMMA:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。

4月3日周五
  1. Google Research39

    Google 如何评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。

4月1日周三
3月18日周三
3月17日周二
2月26日周四
2月23日周一
2月19日周四
2月18日周三
2月4日周三
1月27日周二
1月21日周三
12月17日周三
12月16日周二
12月9日周二
12月4日周四
11月21日周五
11月19日周三
11月4日周二
10月7日周二
  1. Hugging Face Blog38

    Hugging Face 推出 BigCodeArena:通过代码执行端到端评判代码生成

    Hugging Face 发布 BigCodeArena,这是首个通过实际执行来评估代码生成模型的人类参与平台,支持 10 种语言和 8 种执行环境,可实时运行模型生成的代码并投票对比。平台自 2025 年 2 月上线以来已收集超 14,000 次对话、500 多名用户和 4,700+ 偏好投票,o3-mini 与 o1-mini 在 Elo 排名中持续领先。

10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入评测新基准

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。

9月25日周四
5月12日周一
4月10日周四
4月9日周三
4月2日周三
2月18日周二
10月30日周三
10月10日周四
8月13日周二