跳到正文

#Hugging Face

今日 2 条
6月12日周三
6月7日周五
6月6日周四
6月5日周三
6月4日周二
5月29日周三
  1. Mistral AI74

    Mistral 发布首个代码模型 Codestral,22B 参数支持 80+ 编程语言

    Mistral AI 发布首个代码模型 Codestral,这是一个 22B 的开源权重生成式模型,专门面向代码生成任务,支持 80+ 编程语言,包括 Python、Java、C、C++、JavaScript 和 Bash。

    推荐理由:Mistral 首个代码模型给出了 22B 参数、32k 上下文与多语言基准对比,可据此判断其代码补全定位。

5月28日周二
5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。

    推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。

5月22日周三
5月21日周二
5月16日周四
5月14日周二
5月13日周一
  1. Hugging Face Blog71

    Hugging Face 发布 Transformers Agents 2.0

    Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。

    推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。

5月9日周四
5月5日周日
5月3日周五
5月1日周三
4月30日周二
  1. Hugging Face Blog34

    Hugging Face 与 .txt 用结构化生成提升提示词一致性

    Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。

4月29日周一
4月23日周二
4月22日周一
4月19日周五
4月18日周四
  1. Hugging Face Blog80

    Meta 发布 Llama 3 开源大模型,Hugging Face 同步集成

    Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。

    推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。

4月16日周二
4月15日周一
4月11日周四
4月10日周三
4月9日周二
  1. Hugging Face Blog62

    Google 发布 CodeGemma 系列代码模型,含 2B 与 7B 三个版本

    Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。

    推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。