Google DeepMind 发布 Gemini 4 Argon,在 Blueprint-Bench 2 排名第一
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流,当天起通过 Fairwind Program 向一批受信任测试者开放。据 @andonlabs 转述,该模型对物理 3D 世界的理解优于其他 AI,在 Blueprint-Bench 2 上排名第一,该基准要求 AI 智能体根据公寓室内照片绘制户型图。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,面向编码、企业知识工作和网络安全防御等复杂工作流,当天起通过 Fairwind Program 向一批受信任测试者开放。据 @andonlabs 转述,该模型对物理 3D 世界的理解优于其他 AI,在 Blueprint-Bench 2 上排名第一,该基准要求 AI 智能体根据公寓室内照片绘制户型图。
Google 发布语音到语音模型 Gemini 3.8 Live,接替 Gemini 3.1 Flash Live,可在对话同时后台执行工具和 API 调用,分为标准版和支持可配置推理强度的 Extended Thinking 版。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时卫星观测数据,逐小时生成预报。
推荐理由:WeatherNext 3 把实时卫星数据与逐小时更新纳入全球天气预报,读者可据此了解 AI 气象模型在分辨率与降水精度上的进展。
Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。