跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

158条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 121–140 条 · 共 158 条
6月27日周四
6月12日周三
6月5日周三
5月29日周三
  1. Mistral AI74

    Mistral 发布首个代码模型 Codestral,22B 参数支持 80+ 编程语言

    Mistral AI 发布首个代码模型 Codestral,这是一个 22B 的开源权重生成式模型,专门面向代码生成任务,支持 80+ 编程语言,包括 Python、Java、C、C++、JavaScript 和 Bash。

    推荐理由:Mistral 首个代码模型给出了 22B 参数、32k 上下文与多语言基准对比,可据此判断其代码补全定位。

  2. Mistral AI62

    Mistral AI 推出非生产许可 MNPL,Codestral 率先采用

    Mistral AI 发布非生产许可 MNPL,允许开发者将技术用于非商业用途并支持研究工作,Codestral 于当日在该许可下发布。Mistral 表示,此举意在让基于其技术开展业务的一方以公平可持续的方式行事,同时公司会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。

    推荐理由:Mistral 推出 MNPL 非生产许可,读者可了解其开源与商业化的边界如何重新划分。

5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。

    推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。

5月14日周二
5月13日周一
  1. Hugging Face Blog71

    Hugging Face 发布 Transformers Agents 2.0

    Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。

    推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。

4月18日周四
  1. Hugging Face Blog80

    Meta 发布 Llama 3 开源大模型,Hugging Face 同步集成

    Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。

    推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。

4月17日周三
4月15日周一
4月9日周二
  1. Hugging Face Blog62

    Google 发布 CodeGemma 系列代码模型,含 2B 与 7B 三个版本

    Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。

    推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。

3月20日周三
  1. Hugging Face Blog62

    Hugging Face 发布 Cosmopedia:用 Mixtral 生成 250 亿 token 合成预训练数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。

    推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。

2月28日周三
2月21日周三
12月11日周一
  1. Mistral AI87

    Mistral AI 发布开源稀疏 MoE 模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数量 46.7B,但每个 token 只使用 12.9B 参数,因此在同等速度与成本下运行,推理速度比 Llama 2 70B 快 6 倍,并在多数基准上匹配或超过 GPT3.5。

    推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比取舍。

9月27日周三
9月6日周三