Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Artificial Analysis 开发的 LLM 性能排行榜现已登陆 Hugging Face,覆盖超 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等 AGIEval 任务,目前实现 Classic 与 Reflect 两种提示策略,Mixtral-8x7B-Instruct-v0.1 已参与评测。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 对话,尝试套取虚构银行 XYZ001 客户的敏感财务信息,并投票选出隐私保护更强的模型。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本、对比两个 TTS 模型的合成语音并投票选出更自然的一方。首批上线模型包括 ElevenLabs、MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS,投票结果将汇总到采用类 Elo 算法排名的公开排行榜。
Hugging Face 推出 MTEB(Massive Text Embedding Benchmark),一个覆盖 8 类任务、56 个数据集、最多 112 种语言的文本嵌入模型评测基准,排行榜已汇总超 2000 条结果。用户可通过 `pip install mteb` 对任意嵌入模型进行评测,并将结果提交至公开排行榜。
Hugging Face 在 Evaluation on the Hub 上线零样本分类评测,由 AutoTrain 驱动,无需写代码即可评测 Hub 上的任意因果语言模型,目前支持最大 66B 参数模型。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写一行代码即可在 Hub 上用任意数据集和指标评测任意模型。评测结果会以 Pull Request 形式写入模型卡元数据,并可在数据集页面的榜单中对比不同模型表现。官方已用该工具评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集。
推荐理由:原文说明了无需写代码即可在 Hub 上评测任意模型与数据集,并给出配置流程和榜单入口。