微软 GigaPath-Flash 与 GigaTIME-Flash:面向人群规模发现的高效病理基础模型
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频创作控制能力。
推荐理由:官方列出了场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的改动空间。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。
推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。
一个高性能 125B 模型现在仅用 75GB RAM 即可本地运行!感谢 @UnslothAI 的 day-0 支持。🥳
我们刚刚提升了 Cursor 中 Grok 模型的内置用量! 随着 Grok 4.6 的发布,需求不断增长。上个月我们已经通过增加算力将限额翻倍。现在我们再次永久提高限额。 尽情使用吧!
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
GPT-5.6 现已在 Kiro 中可用,帮助开发者完成软件的规划、构建、审查与测试,并带来更好的性价比。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和智能体最强的主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出 3.7 Flash 在编码、文档与业务工作流上的基准对比和限时定价,可据此评估升级与成本。
Grok 4.6 的模型卡已发布,深入介绍了该模型在编码、工程、知识工作等多个评测中的能力,并讨论了部署前安全测试和安全防护栈。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和影像源,获得 Cloud-Optimized GeoTIFF 格式结果。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。
推荐理由:SL2T 把多语言手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。
推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,读者可了解其面向授权漏洞研究的定位与开放渠道。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析和个人助理等隐私敏感场景。
推荐理由:Meta 开源 30B 多模态模型并给出完整基准对比,读者可据此判断本地智能体部署的选型空间。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,提升了准确性和一致性。同时,OpenAI 扩大了 GPT-5.6 Luna 的访问范围,免费用户可进行无限日常对话。
推荐理由:OpenAI 在 ChatGPT 中改进 GPT-5.6 Sol 的准确性与一致性,并向免费用户开放 GPT-5.6 Luna。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……
推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,支持视频理解、任务编排与多机器人协作,并可将动作执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的量化结果,可对照上一代判断具身推理模型的进展。
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的价格,并介绍其更高效的模型如何帮助企业规模化部署 AI 工作流。
推荐理由:OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的价格,读者可据此重新估算企业级 AI 工作流的部署成本。
Google DeepMind 在 Google Flow Music 中推出新一代音乐生成模型 Lyria 3.5,在音乐性、歌词和人声质量上均有明显提升。新版本可生成更复杂自然的旋律结构、提示词遵循度和结构感知更强的歌词,以及更具情感表现力和发音更准确的人声,并支持更便捷地控制输出节奏与时长。该模型即日起在 Flow Music 上线。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:三款模型分别覆盖全身控制、具身推理与端侧部署,读者可据此判断机器人智能层的分工方式。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库部署。
Midjourney 宣布发布 V8.2 并将其设为平台默认模型,这次更新聚焦于美学、个性化和图像质量。作者表示新风格更具创意、更大胆、更前卫和新鲜,个性化效果也比以往更好。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的定价、基准与开放入口,可据此判断智能体工作流的成本与延迟取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出 Gemini 3.5 Flash Cyber 在 CyberGym、Chrome 提交扫描等基准上的对比数据,可了解轻量安全模型的定位与访问限制。
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈提升 AI 安全、对齐与提示词注入鲁棒性。该系统面向红队测试场景,用于自动发现模型弱点并驱动鲁棒性自我改进。
Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。
推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。
OpenAI 宣布 GPT-5.6 成为 Microsoft 365 Copilot 的首选模型,为 Word、Excel、PowerPoint、Chat 和 Cowork 提供更强的 AI 能力,以实现更快、更高质量的工作。
推荐理由:OpenAI 官方说明 GPT-5.6 成为 Microsoft 365 Copilot 首选模型,读者可了解其在 Word、Excel 等应用中的能力变化。
OpenAI 发布 GPT-5.6,官方称其在每个 token 上提供更高智能、每美元更强性能,并可按需为高难度任务提供更多能力。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可对比多传感器方案的成本与效果。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互,目前已用于驱动 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型 GPT-Live,读者可了解它已接入 ChatGPT Voice 这一落地位置。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。