Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 合作发布两款编码智能体模型,读者可据此了解开源编码模型在 SWE-Bench Verified 上的最新位置与定价。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 合作发布两款编码智能体模型,读者可据此了解开源编码模型在 SWE-Bench Verified 上的最新位置与定价。
Hugging Face 博客宣布 Gemma 3n 已在开源生态中全面开放。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时给出开源权重与企业版,并公开训练与强化学习细节,便于对比其推理路线。
Mistral AI 发布首款专为代码设计的嵌入模型 Codestral Embed,在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
OpenAI 将 Operator 的底层模型从 GPT-4o 替换为基于 OpenAI o3 的版本,API 版本仍基于 4o。该变动作为 OpenAI o3 与 o4-mini 系统卡附录公布。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 Devstral 在 SWE-Bench Verified 的分数与开源许可,读者可据此判断它能否用于本地或企业代码智能体。
Hugging Face Blog 发布 Falcon-Edge 系列,这是一系列强大、通用且可微调的 1.58bit 语言模型。
OpenAI o3 能对复杂任务进行推理,帮助自动化多步骤工作流。文章展示了 o3 如何通过推理拆解并处理多环节任务,从而实现工作流的自动化。
Mistral AI 发布 Mistral Medium 3,定位兼顾 SOTA 性能与更低成本,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,便于判断企业自部署的性价比。
OpenAI 宣布最新图像生成模型以 gpt-image-1 的形式在 API 中开放,开发者和企业可将专业级、可定制的视觉内容直接构建进自有工具和平台。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有工具接入图像生成的路径。
OpenAI 发布 o3 和 o4-mini 两款模型,官方称其为目前最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:OpenAI 发布 o3 与 o4-mini,官方称其为目前最强模型并支持完整工具调用,可据此了解其能力定位。
OpenAI 发布 o3 和 o4-mini 系统卡,两款模型将前沿推理能力与完整工具能力结合,支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:系统卡披露 o3 与 o4-mini 将前沿推理与网页浏览、Python、图像分析等工具能力整合,可据此了解其能力边界。
OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上全面提升,并同步发布首个 nano 模型,即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列,并首次推出 nano 版本,可据此了解新模型在编码与长上下文上的能力定位。
Hugging Face 发布博客欢迎 Llama 4 Maverick 与 Scout 上线,正文内容未能获取。
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级真实感输出,也能接收图像作为输入并进行变换。
推荐理由:GPT-4o 图像生成能力较 DALL·E 3 明显提升,并支持图像输入与变换,可据此了解其能力边界。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
OpenAI 发布 GPT-4.5 系统卡,并推出该模型的研究预览版本。OpenAI 称 GPT-4.5 是其目前规模最大、知识最丰富的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡,读者可了解这一研究预览版本的定位与规模描述。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,24B 参数,基于中东和南亚地区精选数据集训练。官方称其回答比体积超过自身 5 倍的模型更准确相关,速度更快、成本更低,可在单 GPU 系统上部署,响应速度超过 150 tokens per second,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤其突出。
推荐理由:Mistral 首个区域语言模型给出 24B 参数、单 GPU 部署与 150 tokens/s 速度,可对照其区域化路线。
OpenAI 发布 o3-mini 模型。
OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。
Mistral AI 发布 Mistral Small 3,一个 24B 参数、Apache 2.0 许可的延迟优化模型,官方称其性能与 Llama 3.3 70B instruct 相当,同硬件上速度超过 3 倍。
推荐理由:24B 模型对标 3 倍参数竞品并给出本地部署门槛,可据此判断小模型在自有硬件上的可用边界。
Hugging Face 发布 Open-R1,对 DeepSeek-R1 进行完全开源的复现。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度从 32k 提升到 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在代码补全场景的位置。
Hugging Face 发布 ModernBERT,称其为 BERT 的替代方案。
Hugging Face 发布 Falcon 3 系列开源模型。
OpenAI 发布 o1 模型,同时为开发者带来 Realtime API 改进、新的微调方法等多项更新。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行扩展、重混和融合,或完全由文本生成新内容。
推荐理由:OpenAI 公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断视频生成能力边界。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重入口,读者可据此判断开源多模态模型与闭源前沿的差距。
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Ministral 3B 和 Ministral 8B 两款面向端侧与本地计算的模型,称其在 10B 以下类别中刷新知识、常识、推理、函数调用和效率表现。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了上下文长度、定价和对比基准,可据此判断小模型在本地与智能体工作流中的位置。
Hugging Face 博客宣布 Llama 3.2 发布,Llama 现在可以看图并能在用户设备上运行。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,可在 128k token 上下文窗口中处理任意数量图片。
推荐理由:官方给出架构、基准与部署方式,读者可据此判断这个 12B 多模态模型在开源阵营中的位置。
OpenAI 发布 o1 模型,官方页面标题为 Introducing OpenAI o1,正文内容未能获取。
OpenAI 发布 o1-mini,官方将其定位为面向高性价比推理的模型。
OpenAI 发布 o1 贡献说明。o1 是 OpenAI 推出的推理模型系列,官方以「Contributions」形式列出参与该模型研发的贡献者名单。
经济学家 Tyler Cowen 解释了 OpenAI o1 如何应对复杂的经济学问题。