Google DeepMind 发布 Co-Scientist 多智能体科研系统
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与跨机构验证案例,可了解AI参与科学假设生成的具体路径。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与跨机构验证案例,可了解AI参与科学假设生成的具体路径。
Google DeepMind 回顾了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用进展,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计和缓存替换策略。
推荐理由:原文汇总了 AlphaEvolve 在基因组、电网、量子物理和商业客户中的落地数据,可据此判断编码智能体的跨领域适用范围。
Google Research 公布其开源工具与开放数据集已支持全球超 25 万名研究人员和开发者。其中基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 已助全球处理 250 万人的外显子与全基因组,Health AI Developer Foundations 及 MedGemma 累计下载超 480 万次。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开了 AI co-clinician 的研究设计与评测结果,读者可了解医疗智能体在证据检索和实时多模态问诊上的能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)开展科研的四个方向:公共卫生、宇宙学、气候与神经科学。
推荐理由:Google Research 用四个真实科研项目展示 ERA 在流行病预测、宇宙学、卫星 CO2 监测和神经回路发现中的具体产出。
Google DeepMind 与韩国科学技术信息通信部(MSIT)建立合作,将在首尔办公室设立 AI Campus,向韩国学术界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。合作覆盖生命科学、能源、天气与气候领域,并探索韩国学生实习机会,同时与韩国 AI 安全研究所(AISI)就安全研究展开协作。
Hugging Face 发布 Transformers.js 浏览器扩展教程,演示如何在 Manifest V3 约束下用 Gemma 4 E2B 构建本地 AI 功能。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新的照片视角重构方法,把照片理解为 3D 场景并在其中自动移动虚拟相机位置。
推荐理由:Google Photos 的 Auto frame 新增 3D 感知重构图能力,读者可了解生成式补全如何改变拍摄后的取景空间。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功与失败经验中蒸馏高层推理模式,实现测试时自我进化。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,推动前沿 AI 在企业的大规模落地。合作包含三大支柱:共建行业专属 AI 能力、让合作伙伴提前使用 Gemini 系列等前沿模型、以及对接 DeepMind 领导层与客户 CEO 和董事会。目前仅 25% 的组织成功将 AI 规模化投入生产。
Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。
Google Research 提出 MoGen(Neuronal Morphology Generation),基于 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自 merge error 的减少。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。
Google 发布研究实验 Vantage,利用生成式 AI 在模拟环境中创建对话,评估高中和大学生面向未来的技能,现已在 Google Labs 开放英文注册。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理、多视角理解与任务成功检测。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力的实现路径。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4,000 段人机多轮对话、近 15,000 轮次,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法与图注生成出版级插图,ScholarPeer 则自动评审论文。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 给出四种尺寸、Apache 2.0 许可与完整工具链支持,可据此判断开源模型在端侧与本地部署上的能力边界。
Hugging Face Blog 发布文章《Welcome Gemma 4: Frontier multimodal intelligence on device》,标题显示 Gemma 4 是一款面向端侧设备的前沿多模态模型。原文正文未能抓取,暂无更多细节。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
Google DeepMind 公布了一套 AI 指针的交互原则,让指针不仅知道指向什么,还能理解它对用户的意义,由 Gemini 驱动。团队提出四条原则:保持工作流不被打断、用指向加语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转化为可操作实体。
推荐理由:Google DeepMind 公开了 AI 指针的四条交互原则,并说明该能力已进入 Chrome 与 Googlebook,读者可据此判断浏览器内 AI 交互的走向。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其构建了首个经实证验证的工具包,用于在真实场景中测量这类 AI 操纵,并公开了开展同类人类参与者研究所需的全部材料。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好地理解音乐结构,支持按 intro、verse、chorus、bridge 等具体段落提示。
推荐理由:官方给出 Lyria 3 Pro 的时长上限、结构控制能力与多处接入入口,可据此判断音乐生成在现有工作流中的可用范围。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。
Google 发布 TurboQuant 压缩算法,可将 KV cache 量化到 3 bit,无需训练或微调且不损失模型精度,相关论文将亮相 ICLR 2026。
推荐理由:Google 公布 TurboQuant 等三种向量量化算法,读者可了解 KV cache 压缩到 3 bit 且不损失精度的实现路径。
Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究的 Personal Health Agent(PHA)在长期健康支持上优于单一任务应用,实验性 AI 系统识别出 25% 此前被漏诊的"interval cancers"。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出了 AI 在 NHS 乳腺筛查中的前瞻部署数据与人工仲裁交互结果,可了解落地时的数据漂移与仲裁量问题。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出涵盖感知。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统共 6 个 LLM 回答 67 道高温超导专家级问题,由国际专家小组按 6 项指标盲评打分。
Google 宣布在 Flood Hub 上线城市山洪预报,借助新的 AI 方法可在城市地区提前最多 24 小时预测山洪风险。为弥补山洪缺乏地面实测数据的问题,Google 用 Groundsource 方法结合 Gemini 分析公开新闻报道,构建历史山洪事件数据集来训练和评估新模型。
推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的思路与全球覆盖取舍。
Google 推出 Groundsource,一种用 Gemini 从非结构化全球新闻中提取灾害数据的可扩展方法,并开放首个城市山洪数据集,包含 260 万条记录、覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:原文给出了用 Gemini 从新闻抽取灾害数据的方法与验证结果,读者可据此判断 LLM 构建历史基准的可行边界。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。
距 AlphaGo 成为首个击败围棋世界冠军的程序已十年,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。这一突破直接催生了 AlphaFold 2,已折叠科学界已知的 2 亿个蛋白质结构并免费开放,全球超 300 万研究人员使用该数据库。AlphaGo 的搜索与强化学习方法还延伸至 AlphaProof、AlphaEvolve 及 AI co-scientist 等系统。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言、服务超 1 亿使用者的开放语音数据集,采用 CC-BY-4.0 许可。该数据集包含约 1,846 小时 ASR 转写语音和超 565 小时 TTS 高保真录音,由非洲学术与社区机构主导采集,2021 年起历时多年完成。
Google 开源 AI 模型 SpeciesNet 可对相机陷阱图像分类近 2,500 个动物类别,训练数据达 6,500 万张标注图像。该模型配合开源模型 MegaDetector 定位动物,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可达 25 万张以上。过去一年,研究团队已用它识别哥伦比亚的美洲狮、爱达荷州的麋鹿与黑熊、澳大利亚的食火鸡以及坦桑尼亚塞伦盖蒂的狮子和大象。