Llama 4 Maverick 与 Scout 上线 Hugging Face
Hugging Face 发布博客欢迎 Llama 4 Maverick 与 Scout 上线,正文内容未能获取。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Hugging Face 发布博客欢迎 Llama 4 Maverick 与 Scout 上线,正文内容未能获取。
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级真实感输出,也能接收图像作为输入并进行变换。
推荐理由:GPT-4o 图像生成能力较 DALL·E 3 明显提升,并支持图像输入与变换,可据此了解其能力边界。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
OpenAI 发布 GPT-4.5 系统卡,并推出该模型的研究预览版本。OpenAI 称 GPT-4.5 是其目前规模最大、知识最丰富的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡,读者可了解这一研究预览版本的定位与规模描述。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,24B 参数,基于中东和南亚地区精选数据集训练。官方称其回答比体积超过自身 5 倍的模型更准确相关,速度更快、成本更低,可在单 GPU 系统上部署,响应速度超过 150 tokens per second,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤其突出。
推荐理由:Mistral 首个区域语言模型给出 24B 参数、单 GPU 部署与 150 tokens/s 速度,可对照其区域化路线。
OpenAI 发布 o3-mini 模型。
OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。
Mistral AI 发布 Mistral Small 3,一个 24B 参数、Apache 2.0 许可的延迟优化模型,官方称其性能与 Llama 3.3 70B instruct 相当,同硬件上速度超过 3 倍。
推荐理由:24B 模型对标 3 倍参数竞品并给出本地部署门槛,可据此判断小模型在自有硬件上的可用边界。
Hugging Face 发布 Open-R1,对 DeepSeek-R1 进行完全开源的复现。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度从 32k 提升到 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在代码补全场景的位置。
Hugging Face 发布 Falcon 3 系列开源模型。
OpenAI 发布 o1 模型,同时为开发者带来 Realtime API 改进、新的微调方法等多项更新。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行扩展、重混和融合,或完全由文本生成新内容。
推荐理由:OpenAI 公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断视频生成能力边界。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重入口,读者可据此判断开源多模态模型与闭源前沿的差距。
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Ministral 3B 和 Ministral 8B 两款面向端侧与本地计算的模型,称其在 10B 以下类别中刷新知识、常识、推理、函数调用和效率表现。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了上下文长度、定价和对比基准,可据此判断小模型在本地与智能体工作流中的位置。