跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

237条精选相关主题产品更新论文研究开源生态

最新精选

第 41–60 条 · 共 237 条
9月9日周三
  1. X:Microsoft Research (@MSFTResearch)67

    FrogNano 发布:Qwen3.5-4B 纯 RL 后训练,SWE-bench Verified 达 61.5%

    FrogNano 发布,基于 Qwen3.5-4B 后训练,在 SWE-bench Verified 上取得 61.5%,参数量为 4B。该模型不使用知识蒸馏,仅用 TaskPilot 生成的合成任务做纯 RL 训练,共 5 轮迭代、每轮 300 个任务。

    推荐理由:4B 模型仅用 RL 在合成任务上后训练即达到 61.5% SWE-bench Verified,为小模型做编码智能体提供了可参考的训练路径。

9月3日周四
  1. OpenAI News84

    OpenAI 发布 GPT-6 Astra 新一代模型

    OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。

    推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。

  2. OpenAI News68

    OpenAI 发布 GPT-6 Astra 安全概览

    OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。

    推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。

  3. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。

9月2日周三
  1. X:Ammaar Reshi (@ammaar)80

    Gemini 3.8 Flash 发布,输入价格 0.75 美元每百万 token

    Gemini 3.8 Flash 发布,距上一次发布仅 3 周,该 Flash 模型在多项基准上超过旗舰模型,输入价格为 0.75 美元每百万 token。该模型当天已在 AI Studio、Gemini app 和 Antigravity 上线。

    推荐理由:Gemini 3.8 Flash 距上次发布仅 3 周,给出了价格与可用入口,可据此判断轻量模型的迭代节奏。

9月1日周二
8月29日周六
  1. X:SpaceXAI (@SpaceXAI)65

    Grok 4.6 上线 Grok.com、iOS 和 Android

    Grok 4.6 现已在 Grok.com、iOS 和 Android 上线。官方建议将其用于复杂问题、智能体式查询以及构建应用等场景。

    推荐理由:Grok 4.6 已在网页与移动端开放,读者可据此了解新版本覆盖的入口和官方给出的三类使用场景。

8月28日周五
8月27日周四
  1. X:美团 LongCat (@Meituan_LongCat)78

    美团 LongCat-2.0 上线 TokenRhythm,1.6T MoE 原生 1M 上下文并开放 MIT 权重

    LongCat-2.0 已在 TokenRhythm 上线,采用 1.6T MoE 架构、约 48B 激活参数、原生 1M 上下文,并以 MIT 许可开放权重。该模型全程在国内 AI ASIC 超算集群上训练,面向仓库级编码和智能体工作流,可通过 OpenSquilla 使用。

    推荐理由:LongCat-2.0 的参数量、激活规模、上下文长度与开源许可集中披露,可据此判断它在代码与智能体场景的定位。

  2. Google DeepMind71

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。

    推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。

8月21日周五
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。

    推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。

8月14日周五
  1. X:Ammaar Reshi (@ammaar)78

    Gemini 3.7 Flash 发布,年内价格比 3.6 Flash 低 50%

    Gemini 3.7 Flash 发布,年内价格比 3.6 Flash 低 50%,在设计遵循、Web 开发和游戏制作方面有明显提升。该模型已在 AI Studio、Antigravity 和 Gemini API 上线,作者附上了若干 one shot 演示。

    推荐理由:Gemini 3.7 Flash 的价格与能力变化,以及它在 AI Studio、Antigravity 和 Gemini API 的上线渠道,可供读者判断迁移成本。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。

    推荐理由:SL2T 把多语言手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言语音模型,开放权重支持 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。

    推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。

8月10日周一
8月6日周四
8月4日周二
  1. Mistral AI62

    Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……

    推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。