OpenAI 发布生命科学研究模型 GPT-Rosalind
OpenAI 发布 GPT-Rosalind,一款面向生命科学研究的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。
推荐理由:OpenAI 推出面向生命科学的前沿推理模型,读者可了解其针对药物发现与基因组分析的能力定位。
OpenAI 发布 GPT-Rosalind,一款面向生命科学研究的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。
推荐理由:OpenAI 推出面向生命科学的前沿推理模型,读者可了解其针对药物发现与基因组分析的能力定位。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理、多视角理解与任务成功检测。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力的实现路径。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 给出四种尺寸、Apache 2.0 许可与完整工具链支持,可据此判断开源模型在端侧与本地部署上的能力边界。
Hugging Face Blog 发布文章《Welcome Gemma 4: Frontier multimodal intelligence on device》,标题显示 Gemma 4 是一款面向端侧设备的前沿多模态模型。原文正文未能抓取,暂无更多细节。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好地理解音乐结构,支持按 intro、verse、chorus、bridge 等具体段落提示。
推荐理由:官方给出 Lyria 3 Pro 的时长上限、结构控制能力与多处接入入口,可据此判断音乐生成在现有工作流中的可用范围。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。
推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本,针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 公布 GPT-5.4 的小型版本,读者可据此了解其在编码、工具调用与高并发场景中的定位。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,读者可据此判断统一模型对部署选型的影响。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 的 agent 模式与免费 API 端点 labs-leanstral-2603。
推荐理由:官方给出 Leanstral 的开放权重、免费 API 与 FLTEval 基准,读者可据此判断形式化验证编码智能体的成本与可用性。
OpenAI 发布 GPT-5.4 Thinking 系统卡,介绍该模型在安全与对齐方面的评估情况。
OpenAI 发布 GPT-5.4,称其为面向专业工作场景的前沿模型,具备编码、计算机操作、工具搜索能力和 1M token 上下文。OpenAI 表示这是其能力最强、效率最高的前沿模型。
推荐理由:OpenAI 公布 GPT-5.4 的编码、计算机操作与 1M token 上下文等能力定位,可据此判断前沿模型的迭代方向。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。
OpenAI 发布 GPT-5.3 Instant 系统卡,目前仅有标题信息,正文内容尚未获取。
OpenAI 发布 GPT-5.3 Instant,官方称其让日常对话更顺畅、更实用。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 级速度。
推荐理由:原文列出 Nano Banana 2 在主体一致性、文字渲染和分辨率上的具体规格,可对照 Pro 版判断速度与质量的取舍。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证分数,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 Gemini 3.1 Pro 在 ARC-AGI-2 上的验证分数与多端上线范围,可据此判断其推理能力提升幅度。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。
推荐理由:官方给出 Deep Think 在数学、编程与科学基准上的具体成绩和 API 开放路径,可据此判断专业推理模式的当前水位。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15x,上下文窗口为 128k。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 公布首个实时编码模型的生成速度与上下文规格,可据此了解编码模型在低延迟方向上的进展。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可据此了解其编码能力与通用推理结合后的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的选型空间。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 78.5% 刷新 SOTA,OSWorld G 达 79.0%,已在 Hugging Face 开放。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。
推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。
GPT-5 for Work 提供了一份简明指南,讲解 GPT-5 如何在营销、工程、财务、战略、法律和 IT 等领域驱动真实业务工作流,并指导团队如何对其进行评估。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:原文给出 MedGemma 1.5 与 MedASR 的基准提升和开放下载入口,读者可据此判断医疗多模态模型的可用边界。
NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,提供 2B 和 8B 两种参数规模,并在 Physical AI Bench 与 Physical Reasoning 榜单上成为排名第一的开源模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 扩到 256K 并新增轨迹与 2D/3D 定位能力,可据此判断物理 AI 智能体的视频理解边界。
Hugging Face 发布 Falcon-H1-Arabic 阿拉伯语模型家族,含 3B、7B、34B 三个规模,采用 Mamba 与 Transformer 注意力并行的 Falcon-H1 混合架构。
Google DeepMind 回顾 2025 年 8 大研究突破,模型能力从 Gemini 2.5(3 月)推进到 Gemini 3(11 月)与 Gemini 3 Flash(12 月)。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编码模型。该模型主打长程推理、大规模代码转换和增强的网络安全能力。
推荐理由:OpenAI 官方给出 GPT-5.2-Codex 的定位与三项能力方向,可据此了解其编码模型的最新迭代重点。
OpenAI 发布 GPT-5.2 System Card 的增补内容,涉及 GPT-5.2-Codex。原文正文抓取失败,仅标题可用。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方给出与 Mistral OCR 2 的胜率对比、每千页定价和自托管选项,便于评估文档解析成本与合规。
NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核查结果。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟、效率和成本结合,定价为 $0.50/1M 输入 tokens、$3/1M 输出 tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,读者可据此判断它在速度与成本上的取舍。
OpenAI 发布 ChatGPT Images 体验与 API 中的 GPT-Image-1.5,主打更快的图像生成。原文提到可进一步了解最新的 ChatGPT Images 2.5。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。