Cognition CEO 谈如何用 OpenAI o1 编程
Cognition CEO 兼联合创始人 Scott Wu 解释了 OpenAI o1 如何以更接近人类的方式做出编程决策。
Cognition CEO 兼联合创始人 Scott Wu 解释了 OpenAI o1 如何以更接近人类的方式做出编程决策。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:原文给出 Falcon Mamba 的架构取舍、训练数据与两组基准对比,可据此判断无注意力架构在长序列上的位置。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型的能力、限制与安全评估情况。原文正文未能抓取,仅标题可用。
Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上以较大吞吐运行。官方称其在 MMLU 上准确率达 84.0%,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和遵循精确指令做了训练。
推荐理由:原文给出 123B 参数、128k 上下文与多项基准对比,可据此判断单节点部署的成本与能力边界。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
OpenAI 发布 GPT-4o mini,定位为更具成本效率的智能模型。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持最高 128k tokens 上下文窗口,以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型给出 128k 上下文和 Apache 2.0 权重,读者可据此判断它能否直接替换现有 Mistral 7B 部署。
Mistral AI 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,具备线性时间推理能力,权重以 Apache 2.0 许可开放下载。
推荐理由:Mamba 架构在代码场景的落地样本,线性时间推理与 256k token 检索测试给出了与 Transformer 路线对比的具体参照。
Mistral AI 发布专攻 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数尺寸,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 SmolLM 三个尺寸的训练数据配方与评测对比,可据此判断小模型在端侧的表现边界。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 的开源权重生成式模型,专门面向代码生成任务,支持 80+ 编程语言,包括 Python、Java、C、C++、JavaScript 和 Bash。
推荐理由:Mistral 首个代码模型给出了 22B 参数、32k 上下文与多语言基准对比,可据此判断其代码补全定位。
TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。
推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。
OpenAI 发布最新旗舰模型 GPT-4o,同时为 ChatGPT 免费用户开放更多能力。官方称此次发布包含新模型以及面向免费用户的功能扩展,具体能力细节尚未在摘要中给出。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并同步扩大 ChatGPT 免费用户可用能力范围。
OpenAI 发布 GPT-4o,并让 ChatGPT 免费用户获得更多能力。该消息来自 OpenAI 的 Spring Update,具体能力范围与开放细节未在摘要中展开。
推荐理由:OpenAI 发布 GPT-4o,并让 ChatGPT 免费用户获得更多能力,可据此了解模型与免费策略的同步变化。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、流程完全透明且许可宽松的代码大语言模型,仅用 StarCoder2-15B 自身生成指令-响应对进行微调,无需人工标注或从大型专有模型蒸馏数据。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 参数中仅激活 39B,以 Apache 2.0 许可开放。
推荐理由:原文给出 Mixtral 8x22B 的激活参数、上下文窗口与开源许可,读者可据此判断其成本与部署取舍。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可。
推荐理由:8B 参数、Apache 2.0 开源,并给出与更大模型的基准对比和微调入口,便于判断多模态选型。
Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。
推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。
BigCode 发布新一代透明训练的开放代码大模型 StarCoder2,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、训练数据与训练代码,读者可据此了解开源代码模型的数据规模与开放程度。
Mistral AI 发布新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出新旗舰模型的基准对比与 Azure 分发路径,可据此判断其 API 生态位置。
Google 发布新的开源大语言模型 Gemma,Hugging Face 博客以“欢迎 Gemma”为题介绍了该模型。
OpenAI 发布新的嵌入模型,并同步更新 API。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数量 46.7B,但每个 token 只使用 12.9B 参数,因此在同等速度与成本下运行,推理速度比 Llama 2 70B 快 6 倍,并在多数基准上匹配或超过 GPT3.5。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比取舍。
Hugging Face 发布博客欢迎 Mixtral 上线,称其为 SOTA 混合专家模型。
OpenAI 在 DevDay 上发布新模型与开发者产品,包括支持 128K 上下文的 GPT-4 Turbo 且价格更低,以及新的 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API。
推荐理由:OpenAI 在 DevDay 集中公布模型与开发者产品更新,可据此了解其当时的产品线变化。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布,可无限制使用。
推荐理由:Mistral AI 首次公开其开源路线与 Mistral 7B 的基准表现,可了解开放权重模型当时的性能位置。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地、云端(AWS/GCP/Azure)及 HuggingFace 部署。
推荐理由:Mistral 7B 以 Apache 2.0 开源并给出与 Llama 2 系列的逐项对比,读者可据此判断小参数模型的性价比位置。
Hugging Face 发布 Falcon 180B 模型。
Hugging Face 博客发布文章介绍 Code Llama,标题显示这是 Llama 2 面向代码能力的版本。原文正文未能抓取,除标题外暂无更多细节。
Hugging Face 发布 IDEFICS,一个对先进视觉语言模型的开源复现。
Hugging Face 博客发布消息称 Llama 2 已发布,并可在 Hugging Face 上获取。原文正文未能抓取,除标题外暂无更多细节。
Hugging Face 发布面向代码的大语言模型 StarCoder,标题称其在代码任务上达到当时的最先进水平。
OpenAI 发布 GPT-4,称其为扩展深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中仍不及人类。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入能力与基准表现,读者可据此了解这一代模型的定位。