跳到正文

#模型发布

今日 5 条
6月30日周二
  1. Google Research71

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出 TabFM 的零样本表格预测机制与 TabArena 基准表现,读者可据此判断它能否替代传统树模型工作流。

6月26日周五
6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。

    推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。

6月22日周一
6月17日周三
  1. Hugging Face Blog82

    智谱发布 GLM-5.2:面向长程任务,支持 1M token 上下文与 MIT 开源

    智谱发布旗舰模型 GLM-5.2,面向长程任务,首次提供稳定的 1M token 上下文,并以 MIT 许可开源。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,改进后的 MTP 层使投机解码接受长度最高提升 20%。

    推荐理由:GLM-5.2 把 1M 上下文与多档思考强度放进开源许可,读者可据此判断长程编码智能体的选型空间。

6月11日周四
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款音频模型,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音到语音翻译,且持续输出而非等说话人说完再翻译,全程仅落后几秒。

    推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API 与 Google 产品入口,可据此判断实时翻译的落地方式。

6月5日周五
6月4日周四
  1. Google Research50

    Google 开源洪水预报水文建模框架

    Google Research 在 GitHub 开源其水文建模框架,让各国气象水文机构可将 AI 洪水预报集成进自身工作流。该框架为基于 PyTorch 的 Python 包,采用 LSTM 架构,训练流程使用开源 Caravan 数据集,并已与捷克水文气象研究所(CHMI)合作验证。新版模型相较 2024 年基准版本,在有测站流域将可靠预测期延长 6 天,无测站流域延长 1 天。

6月3日周三
  1. OpenAI News60

    OpenAI 为 GPT-Rosalind 推出新能力

    OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学专长、基因组分析与实验工作流能力。

    推荐理由:OpenAI 公布 GPT-Rosalind 在生物推理、药物化学与基因组分析上的能力扩展,读者可据此了解该模型在生命科学场景的定位。

6月2日周二
  1. Hugging Face Blog71

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型

    H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。

6月1日周一
  1. Hugging Face Blog60

    JetBrains 发布 12B MoE 模型 Mellum2,Apache 2.0 开源

    JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。

    推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。

5月20日周三
5月19日周二
5月18日周一
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码能力

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的表现和速度数据,可供读者判断前沿模型在长程任务上的取舍。

5月15日周五
5月7日周四
5月5日周二
  1. OpenAI News67

    OpenAI 发布 GPT-5.5 Instant,更新 ChatGPT 默认模型

    OpenAI 发布 GPT-5.5 Instant,将其作为 ChatGPT 的默认模型。官方称该版本提供更智能、更准确的回答,减少模型幻觉,并改进个性化控制。

    推荐理由:官方给出 GPT-5.5 Instant 作为 ChatGPT 默认模型的能力变化,读者可据此了解默认体验的调整方向。

4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态理解模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。

4月24日周五
4月23日周四
  1. OpenAI News69

    OpenAI 发布 GPT-5.5 模型

    OpenAI 发布 GPT-5.5,该模型面向编码、研究和数据分析等复杂任务,并支持跨工具使用。

    推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析的定位。

4月22日周三
4月16日周四
  1. OpenAI News66

    OpenAI 发布生命科学研究模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,一款面向生命科学研究的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。

    推荐理由:OpenAI 推出面向生命科学的前沿推理模型,读者可了解其针对药物发现与基因组分析的能力定位。

  2. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。

4月13日周一
4月3日周五
4月2日周四
3月26日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。

3月24日周二
  1. Mistral AI66

    Mistral AI 发布 4B 参数语音模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。

3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本,针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 公布 GPT-5.4 的小型版本,读者可据此了解其在编码、工具调用与高并发场景中的定位。

  2. Mistral AI77

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,读者可据此判断统一模型对部署选型的影响。

  3. Mistral AI64

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 的 agent 模式与免费 API 端点 labs-leanstral-2603。

    推荐理由:官方给出 Leanstral 的开放权重、免费 API 与 FLTEval 基准,读者可据此判断形式化验证编码智能体的成本与可用性。

3月5日周四
  1. OpenAI News85

    OpenAI 发布 GPT-5.4,主打编码、计算机操作与 1M token 上下文

    OpenAI 发布 GPT-5.4,称其为面向专业工作场景的前沿模型,具备编码、计算机操作、工具搜索能力和 1M token 上下文。OpenAI 表示这是其能力最强、效率最高的前沿模型。

    推荐理由:OpenAI 公布 GPT-5.4 的编码、计算机操作与 1M token 上下文等能力定位,可据此判断前沿模型的迭代方向。