跳到正文

#评测/基准

今日 14 条
5月24日周五
  1. Hugging Face Blog43

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。

5月14日周二
5月5日周日
5月3日周五
4月30日周二
  1. Hugging Face Blog34

    Hugging Face 与 .txt 用结构化生成提升提示词一致性

    Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。

4月23日周二
4月19日周五
4月16日周二
3月21日周四
3月5日周二
2月27日周二
10月19日周三
10月3日周一
6月28日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Evaluation on the Hub,无需写代码即可评测模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写一行代码即可在 Hub 上用任意数据集和指标评测任意模型。评测结果会以 Pull Request 形式写入模型卡元数据,并可在数据集页面的榜单中对比不同模型表现。官方已用该工具评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集。

    推荐理由:原文说明了无需写代码即可在 Hub 上评测任意模型与数据集,并给出配置流程和榜单入口。