Google DeepMind 发布 Gemini 3.1 Flash-Lite
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。
OpenAI 发布 GPT-5.3 Instant 系统卡,目前仅有标题信息,正文内容尚未获取。
OpenAI 发布 GPT-5.3 Instant,官方称其让日常对话更顺畅、更实用。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 级速度。
推荐理由:原文列出 Nano Banana 2 在主体一致性、文字渲染和分辨率上的具体规格,可对照 Pro 版判断速度与质量的取舍。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证分数,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 Gemini 3.1 Pro 在 ARC-AGI-2 上的验证分数与多端上线范围,可据此判断其推理能力提升幅度。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。
推荐理由:官方给出 Deep Think 在数学、编程与科学基准上的具体成绩和 API 开放路径,可据此判断专业推理模式的当前水位。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的选型空间。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 78.5% 刷新 SOTA,OSWorld G 达 79.0%,已在 Hugging Face 开放。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。
推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。
GPT-5 for Work 提供了一份简明指南,讲解 GPT-5 如何在营销、工程、财务、战略、法律和 IT 等领域驱动真实业务工作流,并指导团队如何对其进行评估。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:原文给出 MedGemma 1.5 与 MedASR 的基准提升和开放下载入口,读者可据此判断医疗多模态模型的可用边界。
NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,提供 2B 和 8B 两种参数规模,并在 Physical AI Bench 与 Physical Reasoning 榜单上成为排名第一的开源模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 扩到 256K 并新增轨迹与 2D/3D 定位能力,可据此判断物理 AI 智能体的视频理解边界。
Hugging Face 发布 Falcon-H1-Arabic 阿拉伯语模型家族,含 3B、7B、34B 三个规模,采用 Mamba 与 Transformer 注意力并行的 Falcon-H1 混合架构。
Google DeepMind 回顾 2025 年 8 大研究突破,模型能力从 Gemini 2.5(3 月)推进到 Gemini 3(11 月)与 Gemini 3 Flash(12 月)。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编码模型。该模型主打长程推理、大规模代码转换和增强的网络安全能力。
推荐理由:OpenAI 官方给出 GPT-5.2-Codex 的定位与三项能力方向,可据此了解其编码模型的最新迭代重点。
OpenAI 发布 GPT-5.2 System Card 的增补内容,涉及 GPT-5.2-Codex。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方给出与 Mistral OCR 2 的胜率对比、每千页定价和自托管选项,便于评估文档解析成本与合规。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核查结果。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟、效率和成本结合,定价为 $0.50/1M 输入 tokens、$3/1M 输出 tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,读者可据此判断它在速度与成本上的取舍。
OpenAI 发布 ChatGPT Images 体验与 API 中的 GPT-Image-1.5,主打更快的图像生成。原文提到可进一步了解最新的 ChatGPT Images 2.5。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:原文给出 GPT-5.2 在 GPQA Diamond 与 FrontierMath 上的新结果,读者可据此了解其在数学与科研任务上的能力边界。
OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列,成为该系列最新模型家族。GPT-5.2 的综合安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡中描述的基本一致。与 OpenAI 其他模型一样,GPT-5.2 的训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:GPT-5.2 系统卡更新说明其安全缓解方案延续 GPT-5 与 GPT-5.1 的框架,可对照前代了解安全策略的连续性。
OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。
推荐理由:OpenAI 公布 GPT-5.2 在推理、长上下文、编码与视觉上的定位,读者可据此判断日常专业工作与智能体流程的升级方向。
Mistral AI 发布新一代编码模型家族 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源模型,分别采用修改版 MIT 和 Apache 2.0 许可。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比,便于判断开源编码模型的当前水位。
Mistral AI 发布 Mistral 3 系列,包括 Mistral Large 3 和 3B、8B、14B 三个尺寸的 Ministral 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的 Apache 2.0 模型家族,读者可据此判断开源权重在端侧与前沿两端的覆盖范围。
UCLA 教授 Ernest Ryu 与 GPT-5 解决了优化理论中的一个关键问题,展示了 AI 在加速数学发现中的作用。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 面向企业以付费预览形式逐步开放。
推荐理由:Google DeepMind 发布 Gemini 3 Pro Image,开发者可据此了解其分辨率、文本渲染与 Google 搜索接地等能力边界。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更强推理与世界知识、图像内多语言文字渲染,以及最多融合 14 张图像、保持 5 人一致性的编辑能力,支持 2K 和 4K 分辨率与多种画幅。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,读者可据此判断图像生成在自身工作流中的可用性。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述该模型的安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练,产品层面则涵盖智能体沙箱与可配置网络访问。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型面向长时间、项目级任务设计,具备更强的推理能力和 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可了解其在长时任务与 token 效率上的定位。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,同步上线 Gemini app、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数和上线渠道,可据此判断能力代际变化。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:官方给出 WeatherNext 2 的提速幅度、分辨率与开放入口,可据此判断 AI 天气预报的可用边界。
OpenAI 在 API 中上线 GPT-5.1,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。该版本还新增 apply_patch 和 shell 工具。
推荐理由:GPT-5.1 在 API 上线,给出推理速度、缓存与编码能力变化,开发者可据此评估迁移。