OpenAI 在 GPT-4o 中引入原生图像生成
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级真实感输出,也能接收图像作为输入并进行变换。
推荐理由:GPT-4o 图像生成能力较 DALL·E 3 明显提升,并支持图像输入与变换,可据此了解其能力边界。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
OpenAI 发布 GPT-4.5 系统卡,并推出该模型的研究预览版本。OpenAI 称 GPT-4.5 是其目前规模最大、知识最丰富的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡,读者可了解这一研究预览版本的定位与规模描述。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,24B 参数,基于中东和南亚地区精选数据集训练。官方称其回答比体积超过自身 5 倍的模型更准确相关,速度更快、成本更低,可在单 GPU 系统上部署,响应速度超过 150 tokens per second,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤其突出。
推荐理由:Mistral 首个区域语言模型给出 24B 参数、单 GPU 部署与 150 tokens/s 速度,可对照其区域化路线。
OpenAI 发布 o3-mini 模型。
OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。
Mistral AI 发布 Mistral Small 3,一个 24B 参数、Apache 2.0 许可的延迟优化模型,官方称其性能与 Llama 3.3 70B instruct 相当,同硬件上速度超过 3 倍。
推荐理由:24B 模型对标 3 倍参数竞品并给出本地部署门槛,可据此判断小模型在自有硬件上的可用边界。
Hugging Face 发布 Open-R1,对 DeepSeek-R1 进行完全开源的复现。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度从 32k 提升到 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在代码补全场景的位置。
Hugging Face 发布 ModernBERT,称其为 BERT 的替代方案。
Hugging Face 发布 Falcon 3 系列开源模型。
OpenAI 发布 o1 模型,同时为开发者带来 Realtime API 改进、新的微调方法等多项更新。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行扩展、重混和融合,或完全由文本生成新内容。
推荐理由:OpenAI 公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断视频生成能力边界。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重入口,读者可据此判断开源多模态模型与闭源前沿的差距。
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Ministral 3B 和 Ministral 8B 两款面向端侧与本地计算的模型,称其在 10B 以下类别中刷新知识、常识、推理、函数调用和效率表现。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了上下文长度、定价和对比基准,可据此判断小模型在本地与智能体工作流中的位置。
Hugging Face 博客宣布 Llama 3.2 发布,Llama 现在可以看图并能在用户设备上运行。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,可在 128k token 上下文窗口中处理任意数量图片。
推荐理由:官方给出架构、基准与部署方式,读者可据此判断这个 12B 多模态模型在开源阵营中的位置。
OpenAI 发布 o1 模型,官方页面标题为 Introducing OpenAI o1,正文内容未能获取。
OpenAI 发布 o1-mini,官方将其定位为面向高性价比推理的模型。
OpenAI 发布 o1 贡献说明。o1 是 OpenAI 推出的推理模型系列,官方以「Contributions」形式列出参与该模型研发的贡献者名单。
经济学家 Tyler Cowen 解释了 OpenAI o1 如何应对复杂的经济学问题。
Cognition CEO 兼联合创始人 Scott Wu 解释了 OpenAI o1 如何以更接近人类的方式做出编程决策。
阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:原文给出 Falcon Mamba 的架构取舍、训练数据与两组基准对比,可据此判断无注意力架构在长序列上的位置。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型的能力、限制与安全评估情况。原文正文未能抓取,仅标题可用。
Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上以较大吞吐运行。官方称其在 MMLU 上准确率达 84.0%,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和遵循精确指令做了训练。
推荐理由:原文给出 123B 参数、128k 上下文与多项基准对比,可据此判断单节点部署的成本与能力边界。
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
OpenAI 发布 GPT-4o mini,定位为更具成本效率的智能模型。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持最高 128k tokens 上下文窗口,以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型给出 128k 上下文和 Apache 2.0 权重,读者可据此判断它能否直接替换现有 Mistral 7B 部署。
Mistral AI 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,具备线性时间推理能力,权重以 Apache 2.0 许可开放下载。
推荐理由:Mamba 架构在代码场景的落地样本,线性时间推理与 256k token 检索测试给出了与 Transformer 路线对比的具体参照。
Mistral AI 发布专攻 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数尺寸,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 SmolLM 三个尺寸的训练数据配方与评测对比,可据此判断小模型在端侧的表现边界。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。