跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 21–40 条 · 共 87 条
9月23日周三
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。

9月22日周二
  1. X:SpaceXAI (@SpaceXAI)78

    xAI 发布 Grok 4.7,上线 Cursor、Grok Build 与 Grok API

    xAI 发布 Grok 4.7,已在 Cursor、Grok Build 和 Grok API 上线,官方称这是其面向编码与知识工作的最强模型。官方还称其速度是同类模型的两倍、价格为同类模型的一半,详情见 x.ai/news/grok-4-7。

    推荐理由:官方给出 Grok 4.7 在 Cursor、Grok Build 与 API 的上线入口,并称其速度翻倍、价格减半,可据此判断编码场景的选型。

9月20日周日
  1. X:通义千问 / Qwen (@Alibaba_Qwen)69

    阿里通义千问发布 Qwen-Image-2.1 图像生成模型并开放权重

    阿里通义千问发布 Qwen-Image-2.1,称其为 Qwen-Image 系列中最均衡、最具性价比的图像生成模型,现已开放权重。该模型统一支持生成与编辑,采用 7B 轻量架构,官方称其性能超过多数闭源模型,并大幅加速多图输入的推理。

    推荐理由:官方给出 7B 轻量架构、RGBA 原生透明与最多 10 张参考图编辑等要点,可据此判断图像生成与编辑的开放权重选择。

9月17日周四
  1. X:商汤 SenseTime (@SenseTime_AI)71

    商汤发布 SenseNova U1.5 技术报告:开源 8B-MoT 原生统一模型

    商汤发布 SenseNova U1.5 技术报告,推出开源 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。模型采用 Pixel Shuffle 加 3×3 空间卷积实现原生 4K 生成,并用多专家在线策略蒸馏整合美学、OCR、信息图与编辑能力。

    推荐理由:技术报告与训练配方同步开源,读者可据此了解统一多模态模型如何打通理解与生成。

9月16日周三
9月10日周四
  1. OpenAI News69

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,支持自定义音色和电话通信(telephony)支持。

    推荐理由:OpenAI 在 API 中上线 GPT-Live-1,语音能力从演示走向可调用,开发者可据此评估接入方式。

9月9日周三
9月3日周四
  1. OpenAI News84

    OpenAI 发布 GPT-6 Astra 新一代模型

    OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。

    推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。

  2. OpenAI News68

    OpenAI 发布 GPT-6 Astra 安全概览

    OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。

    推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。

  3. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。

9月1日周二
8月29日周六
  1. X:SpaceXAI (@SpaceXAI)65

    Grok 4.6 上线 Grok.com、iOS 和 Android

    Grok 4.6 现已在 Grok.com、iOS 和 Android 上线。官方建议将其用于复杂问题、智能体式查询以及构建应用等场景。

    推荐理由:Grok 4.6 已在网页与移动端开放,读者可据此了解新版本覆盖的入口和官方给出的三类使用场景。

8月28日周五
8月27日周四
  1. X:美团 LongCat (@Meituan_LongCat)78

    美团 LongCat-2.0 上线 TokenRhythm,1.6T MoE 原生 1M 上下文并开放 MIT 权重

    LongCat-2.0 已在 TokenRhythm 上线,采用 1.6T MoE 架构、约 48B 激活参数、原生 1M 上下文,并以 MIT 许可开放权重。该模型全程在国内 AI ASIC 超算集群上训练,面向仓库级编码和智能体工作流,可通过 OpenSquilla 使用。

    推荐理由:LongCat-2.0 的参数量、激活规模、上下文长度与开源许可集中披露,可据此判断它在代码与智能体场景的定位。

  2. Google DeepMind71

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。

    推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。