跳到正文

#评测/基准

今日 0 条
11月21日周五
11月19日周三
11月4日周二
10月7日周二
  1. Hugging Face Blog38

    Hugging Face 推出 BigCodeArena:通过代码执行端到端评判代码生成

    Hugging Face 发布 BigCodeArena,这是首个通过实际执行来评估代码生成模型的人类参与平台,支持 10 种语言和 8 种执行环境,可实时运行模型生成的代码并投票对比。平台自 2025 年 2 月上线以来已收集超 14,000 次对话、500 多名用户和 4,700+ 偏好投票,o3-mini 与 o1-mini 在 Elo 排名中持续领先。

10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入评测新基准

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。

9月25日周四
5月12日周一
4月10日周四
4月9日周三
4月2日周三
2月18日周二
10月30日周三
10月10日周四
8月13日周二
7月25日周四
7月1日周一
  1. Hugging Face Blog60

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。

6月18日周二
6月6日周四
5月24日周五
  1. Hugging Face Blog43

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。

5月14日周二
5月5日周日
5月3日周五
4月30日周二
  1. Hugging Face Blog34

    Hugging Face 与 .txt 用结构化生成提升提示词一致性

    Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。

4月23日周二
4月19日周五
4月16日周二
3月21日周四
3月5日周二
2月27日周二
10月19日周三
10月3日周一
6月28日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Evaluation on the Hub,无需写代码即可评测模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写一行代码即可在 Hub 上用任意数据集和指标评测任意模型。评测结果会以 Pull Request 形式写入模型卡元数据,并可在数据集页面的榜单中对比不同模型表现。官方已用该工具评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集。

    推荐理由:原文说明了无需写代码即可在 Hub 上评测任意模型与数据集,并给出配置流程和榜单入口。