Google 发布 TabFM:面向表格数据的零样本基础模型
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的零样本表格预测机制与 TabArena 基准表现,读者可据此判断它能否替代传统树模型工作流。
Google 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出 TabFM 的零样本表格预测机制与 TabArena 基准表现,读者可据此判断它能否替代传统树模型工作流。
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。
推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M,其中 small 和 medium 支持 50 种语言。
推荐理由:原文给出三档模型参数、检测与识别指标及多后端接入方式,便于按部署场景选型。
智谱发布旗舰模型 GLM-5.2,面向长程任务,首次提供稳定的 1M token 上下文,并以 MIT 许可开源。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,改进后的 MTP 层使投机解码接受长度最高提升 20%。
推荐理由:GLM-5.2 把 1M 上下文与多档思考强度放进开源许可,读者可据此判断长程编码智能体的选型空间。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,可据此判断本地交互式推理的可行边界。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款音频模型,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音到语音翻译,且持续输出而非等说话人说完再翻译,全程仅落后几秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API 与 Google 产品入口,可据此判断实时翻译的落地方式。
Google DeepMind 发布 Gemma 4 12B,定位为可在笔记本本地运行的多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,并给出 16GB 显存本地运行的边界。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,把多模态输入、多语言覆盖、自定义企业策略执行和可审计推理统一到一次推理调用中。
推荐理由:NVIDIA 把多模态、多语言、自定义策略与可审计推理合并进一次推理调用,并公开训练数据集。
Google Research 在 GitHub 开源其水文建模框架,让各国气象水文机构可将 AI 洪水预报集成进自身工作流。该框架为基于 PyTorch 的 Python 包,采用 LSTM 架构,训练流程使用开源 Caravan 数据集,并已与捷克水文气象研究所(CHMI)合作验证。新版模型相较 2024 年基准版本,在有测站流域将可靠预测期延长 6 天,无测站流域延长 1 天。
OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学专长、基因组分析与实验工作流能力。
推荐理由:OpenAI 公布 GPT-Rosalind 在生物推理、药物化学与基因组分析上的能力扩展,读者可据此了解该模型在生命科学场景的定位。
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face 发布 OlmoEarth v1.1,在保持 v1 性能的前提下将计算成本最多降低 3 倍。该系列通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,并修改预训练方案以避免性能下降,提供 Base、Tiny、Nano 三种规模权重及训练代码。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排模型,参数规模从 17m 到 1b,均基于 Ettin ModernBERT 编码器,并开源训练数据与完整训练配方。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可据此判断视频创作流程的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的表现和速度数据,可供读者判断前沿模型在长程任务上的取舍。
IBM 在 Hugging Face 发布 Granite Embedding Multilingual R2 系列两款 Apache 2.0 多语言嵌入模型,均基于 ModernBERT,支持 200+ 语言、32K token 上下文(较 R1 提升 64 倍)并新增 9 种编程语言的代码检索。
OpenAI 扩展 Trusted Access for Cyber 计划,新增 GPT-5.5 和 GPT-5.5-Cyber,帮助经过验证的防御方加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 在网络安全场景扩展可信访问计划,读者可了解 GPT-5.5 系列面向防御方的开放范围。
OpenAI 在 API 中推出新的实时语音模型,可进行推理、翻译和语音转写,用于构建更自然、更智能的语音体验。
OpenAI 发布 GPT-5.5 Instant,将其作为 ChatGPT 的默认模型。官方称该版本提供更智能、更准确的回答,减少模型幻觉,并改进个性化控制。
推荐理由:官方给出 GPT-5.5 Instant 作为 ChatGPT 默认模型的能力变化,读者可据此了解默认体验的调整方向。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。
推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。
推荐理由:DeepSeek-V4 把长上下文推理成本压到 V3.2 的一成量级,读者可据此判断智能体长任务工作流的可行性。
OpenAI 发布 GPT-5.5 系统卡,用于说明该模型的安全评估与部署情况。原文正文未能获取,具体内容暂不可知。
OpenAI 发布 GPT-5.5,该模型面向编码、研究和数据分析等复杂任务,并支持跨工具使用。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析的定位。
OpenAI 发布 Privacy Filter,这是一款开放权重模型,用于检测和脱敏文本中的个人身份信息(PII),官方称其准确率达到 state-of-the-art 水平。
推荐理由:OpenAI 开源了一款用于识别和脱敏文本中个人身份信息的模型,可了解其在 PII 检测上的定位。
OpenAI 发布 GPT-Rosalind,一款面向生命科学研究的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。
推荐理由:OpenAI 推出面向生命科学的前沿推理模型,读者可了解其针对药物发现与基因组分析的能力定位。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理、多视角理解与任务成功检测。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力的实现路径。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 给出四种尺寸、Apache 2.0 许可与完整工具链支持,可据此判断开源模型在端侧与本地部署上的能力边界。
Hugging Face Blog 发布文章《Welcome Gemma 4: Frontier multimodal intelligence on device》,标题显示 Gemma 4 是一款面向端侧设备的前沿多模态模型。原文正文未能抓取,暂无更多细节。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好地理解音乐结构,支持按 intro、verse、chorus、bridge 等具体段落提示。
推荐理由:官方给出 Lyria 3 Pro 的时长上限、结构控制能力与多处接入入口,可据此判断音乐生成在现有工作流中的可用范围。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。
推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本,针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。
推荐理由:OpenAI 公布 GPT-5.4 的小型版本,读者可据此了解其在编码、工具调用与高并发场景中的定位。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,读者可据此判断统一模型对部署选型的影响。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral vibe 的 agent 模式与免费 API 端点 labs-leanstral-2603。
推荐理由:官方给出 Leanstral 的开放权重、免费 API 与 FLTEval 基准,读者可据此判断形式化验证编码智能体的成本与可用性。
OpenAI 发布 GPT-5.4 Thinking 系统卡,介绍该模型在安全与对齐方面的评估情况。
OpenAI 发布 GPT-5.4,称其为面向专业工作场景的前沿模型,具备编码、计算机操作、工具搜索能力和 1M token 上下文。OpenAI 表示这是其能力最强、效率最高的前沿模型。
推荐理由:OpenAI 公布 GPT-5.4 的编码、计算机操作与 1M token 上下文等能力定位,可据此判断前沿模型的迭代方向。