Google 发布 EmbeddingGemma 多语言嵌入模型
Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。
Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 发布语音到语音新模型并扩展 Realtime API,读者可了解语音交互能力与接口支持的变化。
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学场景打造,双方合作将其应用于蛋白质工程。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万条多语言推理样本。
OpenAI 发布 GPT-5,称其为公司目前最先进的模型,面向企业 AI、自动化和劳动力生产力场景。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布内容介绍如何用 GPT-5 进行编码与设计,称其在编码和设计上带来新的可能性。原文仅提供摘要,未给出具体功能、示例或数据。
OpenAI 介绍了 GPT-5 在医学研究中的用途。
OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方表示 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到当前最优表现。
推荐理由:OpenAI 官方公布 GPT-5 的定位与能力覆盖范围,可据此了解其相对前代模型的提升方向。
OpenAI 发布 GPT-5,并展示一组领先开发者首次使用该模型的过程。
OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统实现快速与智能的响应。该系统调用 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,针对不同任务和开发者用途做优化。
推荐理由:系统卡披露 GPT-5 用统一路由在 gpt-5-main、gpt-5-thinking 与轻量版本间分配任务,可了解其能力分层思路。
OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、灵活并覆盖全球的一步。官方表示,其使命是让尽可能多的人用上 AI,此次发布是朝这一方向的重要进展。
推荐理由:OpenAI 官方说明开放权重模型发布,读者可了解其开放与可及性主张。
OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称其在推理任务上优于同规模开放模型,具备较强工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开放权重模型以 Apache 2.0 发布,读者可据此判断消费级硬件部署与工具调用的可行边界。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重推理模型,采用 Apache 2.0 许可,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 公开两款开放权重推理模型的许可与使用政策,可据此了解其开放范围与使用条件。
Hugging Face 博客发文欢迎 OpenAI 推出新的开源模型家族 GPT OSS。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型将研究、浏览器自动化和代码工具整合在一起。系统卡还说明该模型在 Preparedness Framework 下配备了相应防护措施。
推荐理由:系统卡披露了 ChatGPT agent 如何把研究、浏览器自动化与代码工具整合,并说明其在 Preparedness Framework 下的防护设计。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 协议开源并上线自家 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:官方给出两款语音理解模型的尺寸、开源协议与 API 定价,可对照 Whisper、GPT-4o mini 等基准判断其成本位置。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 合作发布两款编码智能体模型,读者可据此了解开源编码模型在 SWE-Bench Verified 上的最新位置与定价。
Hugging Face 博客宣布 Gemma 3n 已在开源生态中全面开放。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时给出开源权重与企业版,并公开训练与强化学习细节,便于对比其推理路线。
Mistral AI 发布首款专为代码设计的嵌入模型 Codestral Embed,在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
OpenAI 将 Operator 的底层模型从 GPT-4o 替换为基于 OpenAI o3 的版本,API 版本仍基于 4o。该变动作为 OpenAI o3 与 o4-mini 系统卡附录公布。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 Devstral 在 SWE-Bench Verified 的分数与开源许可,读者可据此判断它能否用于本地或企业代码智能体。
OpenAI 发布 o3 和 o4-mini 系统卡的补充文件,对象是云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,目标是生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
Hugging Face Blog 发布 Falcon-Edge 系列,这是一系列强大、通用且可微调的 1.58bit 语言模型。
Mistral AI 发布 Mistral Medium 3,定位兼顾 SOTA 性能与更低成本,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,便于判断企业自部署的性价比。
OpenAI 已回滚上周在 ChatGPT 中推送的 GPT-4o 更新,用户现在使用的是行为更平衡的早期版本。被移除的更新表现为过度奉承或迎合,常被描述为 sycophantic。
推荐理由:OpenAI 官方说明 GPT-4o 更新因过度迎合被回滚,读者可了解这次行为异常的处理方式。
OpenAI 宣布最新图像生成模型以 gpt-image-1 的形式在 API 中开放,开发者和企业可将专业级、可定制的视觉内容直接构建进自有工具和平台。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有工具接入图像生成的路径。
OpenAI 发布 o3 和 o4-mini 两款模型,官方称其为目前最智能、能力最强的模型,并支持完整的工具调用。
推荐理由:OpenAI 发布 o3 与 o4-mini,官方称其为目前最强模型并支持完整工具调用,可据此了解其能力定位。
OpenAI 发布 o3 和 o4-mini 系统卡,两款模型将前沿推理能力与完整工具能力结合,支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:系统卡披露 o3 与 o4-mini 将前沿推理与网页浏览、Python、图像分析等工具能力整合,可据此了解其能力边界。
OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上全面提升,并同步发布首个 nano 模型,即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列,并首次推出 nano 版本,可据此了解新模型在编码与长上下文上的能力定位。
Hugging Face 发布博客欢迎 Llama 4 Maverick 与 Scout 上线,正文内容未能获取。
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级真实感输出,也能接收图像作为输入并进行变换。
推荐理由:GPT-4o 图像生成能力较 DALL·E 3 明显提升,并支持图像输入与变换,可据此了解其能力边界。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
OpenAI 发布 GPT-4.5 系统卡,并推出该模型的研究预览版本。OpenAI 称 GPT-4.5 是其目前规模最大、知识最丰富的模型。
推荐理由:OpenAI 公布 GPT-4.5 系统卡,读者可了解这一研究预览版本的定位与规模描述。
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,24B 参数,基于中东和南亚地区精选数据集训练。官方称其回答比体积超过自身 5 倍的模型更准确相关,速度更快、成本更低,可在单 GPU 系统上部署,响应速度超过 150 tokens per second,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤其突出。
推荐理由:Mistral 首个区域语言模型给出 24B 参数、单 GPU 部署与 150 tokens/s 速度,可对照其区域化路线。
OpenAI 发布 o3-mini 模型。
OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。