跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

252条精选相关主题产品更新论文研究开源生态

最新精选

第 221–240 条 · 共 252 条
5月13日周一
4月18日周四
  1. Hugging Face Blog80

    Meta 发布 Llama 3 开源大模型,Hugging Face 同步集成

    Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。

    推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。

4月17日周三
4月15日周一
4月9日周二
  1. Hugging Face Blog62

    Google 发布 CodeGemma 系列代码模型,含 2B 与 7B 三个版本

    Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。

    推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。

2月28日周三
2月26日周一
2月21日周三
12月11日周一
  1. Mistral AI87

    Mistral AI 发布开源稀疏 MoE 模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数量 46.7B,但每个 token 只使用 12.9B 参数,因此在同等速度与成本下运行,推理速度比 Llama 2 70B 快 6 倍,并在多数基准上匹配或超过 GPT3.5。

    推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比取舍。

11月6日周一
9月27日周三
9月6日周三
8月25日周五
8月22日周二
7月18日周二
5月4日周四
3月14日周二
  1. OpenAI News91

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩展深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中仍不及人类。

    推荐理由:OpenAI 官方给出 GPT-4 的多模态输入能力与基准表现,读者可据此了解这一代模型的定位。

  2. OpenAI News86

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4,官方称其可在创意与技术写作任务中生成、编辑内容并与用户反复迭代,例如作曲、写剧本或学习用户的写作风格。

    推荐理由:OpenAI 官方公布 GPT-4 的写作能力,读者可据此了解它在创作与技术写作任务上的定位。