Google DeepMind 更新 Veo 3.1 Ingredients to Video,支持原生竖屏与 1080p/4K 升采样
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频更富表现力,并提升角色、背景与物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的变化,可据此判断移动端短视频工作流会怎么变。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频更富表现力,并提升角色、背景与物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的变化,可据此判断移动端短视频工作流会怎么变。
Google Research 在 Science Advances 发表论文,介绍 NeuralGCM 直接使用 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟中对比 ECMWF 等模型的误差变化值得关注。
Google DeepMind 回顾 2025 年 8 大研究突破,模型能力从 Gemini 2.5(3 月)推进到 Gemini 3(11 月)与 Gemini 3 Flash(12 月)。
Google Research 回顾 2025 年进展:Gemini 3 成为 Google 事实性最强的 LLM,在 SimpleQA Verified 和 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入生成式 UI,可动态生成网页、游戏、工具等交互界面。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟、效率和成本结合,定价为 $0.50/1M 输入 tokens、$3/1M 输出 tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,读者可据此判断它在速度与成本上的取舍。
Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。
Google Research 为 STOC 2026 打造实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内给出结构化预审反馈。
推荐理由:Google 披露 PAT 在 STOC 2026 的试用数据,读者可据此判断 AI 预审在数学证明类写作中的实际边界。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办非洲健康数据科学 Ideathon,从 30 多份提交中选出六支决赛团队,围绕 MedGemma、TxGemma 和 MedSigLIP 等开放健康 AI 模型开发解决方案。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并发布联合报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。该合作是 Google DeepMind 与英国政府推进安全 AI 整体协作的一部分。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。
Google DeepMind 宣布深化与英国政府的合作,聚焦用 AI 加速科学发现、教育、公共服务现代化及国家安全。合作将向英国科学家优先开放 AlphaEvolve、AlphaGenome、AI co-scientist 和 WeatherNext 等"AI for Science"模型,并于 2026 年在英国建立其首个自动化材料科学实验室。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将深度神经网络作为长期记忆模块,结合 RNN 的速度与 Transformer 的精度。
推荐理由:Google Research 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,读者可了解长上下文建模的新思路。
密歇根州立大学 Berkley Walker 团队借助 AlphaFold 预测植物与嗜热藻类中光合作用关键酶 GLYK 的 3D 结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。研究人员据此用藻类 GLYK 中更刚性的环替换植物版的不稳定环,构建出杂合酶,其中一种在高达 65 °C 下仍保持稳定。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
AlphaFold 2 自 2020 年在 CASP 14 上解决蛋白质结构预测难题以来,已向全球 190 多个国家的超 300 万研究人员免费开放 AlphaFold Protein Database,累计预测超 2 亿个蛋白质结构。
Google DeepMind 发布博文介绍,密苏里大学研究人员借助 AlphaFold 与冷冻电镜(cryo-EM)数据,解析出“坏胆固醇”关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 预测与冷冻电镜数据结合解析 apoB100 结构,展示了 AI 在结构生物学中的具体用法。
Google DeepMind 宣布支持白宫 Genesis Mission,并与美国能源部合作,向 DOE 全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与 DOE 的合作给出了 AI for Science 从模型到国家实验室落地的具体路径,可观察前沿模型在科研场景的接入方式。
Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。
Google DeepMind 在 Gemini 应用中上线 AI 图片验证功能,用户上传图片并提问“Was this created with Google AI?
推荐理由:原文说明了 Gemini 应用内验证 AI 图片的具体操作方式,以及 SynthID 与 C2PA 两条技术路线的分工。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 面向企业以付费预览形式逐步开放。
推荐理由:Google DeepMind 发布 Gemini 3 Pro Image,开发者可据此了解其分辨率、文本渲染与 Google 搜索接地等能力边界。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更强推理与世界知识、图像内多语言文字渲染,以及最多融合 14 张图像、保持 5 人一致性的编辑能力,支持 2K 和 4K 分辨率与多种画幅。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,读者可据此判断图像生成在自身工作流中的可用性。
Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google DeepMind 在新加坡开设新研究实验室,聚焦推进 Gemini 核心能力与亚太语言文化包容性研究,其亚太团队过去一年规模已翻倍以上。新实验室将与当地政府、企业和学术机构合作,此前已与 AI Singapore 推出东南亚语言开放数据平台 Project Aquarium,并支持基于 Gemma 3 多模态能力构建的 SEA-LION v4 发布。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,同步上线 Gemini app、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数和上线渠道,可据此判断能力代际变化。
Google 发布智能体开发平台 Google Antigravity,即日起公开预览且免费,Gemini 3 Pro 使用有较宽松的速率限制。该平台在 AI IDE 的 Editor 视图之外新增智能体优先的 Manager 视图,可并行编排多个工作区中的智能体,并支持浏览器控制、异步交互与 Artifacts 交付物。
推荐理由:Google 官方给出 Antigravity 的四个设计原则与公开预览入口,可据此判断智能体优先 IDE 的形态变化。
Google 发布生成式 UI 实现,由模型针对任意提示词自动设计并编码出网页、游戏、工具等交互界面,论文题为 Generative UI: LLMs are Effective UI Generators。
推荐理由:Google 官方给出生成式 UI 的实现路径与人类偏好评测结果,可据此判断界面生成这一方向的成熟度。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,生成预报速度提升 8 倍,分辨率最高可达 1 小时。
推荐理由:官方给出 WeatherNext 2 的提速幅度、分辨率与开放入口,可据此判断 AI 天气预报的可用边界。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率的天然林地图与数据集,在独立全球数据集上验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。
Google Quantum AI 联合斯坦福、MIT、Caltech 在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉将优化问题转化为解码问题求解。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业用开放模型构建自己的 AI。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于大规模机器学习差分隐私训练的模块化工具库。新版本集成最新 DP 算法研究成果,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等方法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行,可在多加速器和超算上训练大模型。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。
北爱尔兰 C2k 项目与 Google for Education 合作的六个月试点中,100 名教师将 Gemini 和 Google Workspace 工具引入课堂,每位参与教师平均每周节省 10 小时,并累计产生 600 多个 Gemini 使用案例。
Google Research 在 NeurIPS 2025 论文中提出 Nested Learning,将模型架构与优化算法统一视为多层嵌套的优化问题,每层拥有各自的 context flow 和更新频率,以缓解灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划迭代三项创新,在 DABStep、KramaBench、DA-Code 上超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作推出森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度上预测风险。