Google 发布白皮书:量子计算机破解 ECDLP-256 所需资源大幅下降
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
Google DeepMind 公布了一套 AI 指针的交互原则,让指针不仅知道指向什么,还能理解它对用户的意义,由 Gemini 驱动。团队提出四条原则:保持工作流不被打断、用指向加语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转化为可操作实体。
推荐理由:Google DeepMind 公开了 AI 指针的四条交互原则,并说明该能力已进入 Chrome 与 Googlebook,读者可据此判断浏览器内 AI 交互的走向。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其构建了首个经实证验证的工具包,用于在真实场景中测量这类 AI 操纵,并公开了开展同类人类参与者研究所需的全部材料。
Google DeepMind 发布 Lyria 3 Pro,可生成最长 3 分钟的曲目,并更好地理解音乐结构,支持按 intro、verse、chorus、bridge 等具体段落提示。
推荐理由:官方给出 Lyria 3 Pro 的时长上限、结构控制能力与多处接入入口,可据此判断音乐生成在现有工作流中的可用范围。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。
Google 发布 TurboQuant 压缩算法,可将 KV cache 量化到 3 bit,无需训练或微调且不损失模型精度,相关论文将亮相 ICLR 2026。
推荐理由:Google 公布 TurboQuant 等三种向量量化算法,读者可了解 KV cache 压缩到 3 bit 且不损失精度的实现路径。
Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究的 Personal Health Agent(PHA)在长期健康支持上优于单一任务应用,实验性 AI 系统识别出 25% 此前被漏诊的"interval cancers"。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺筛查系统。
推荐理由:两项 Nature Cancer 研究给出了 AI 在 NHS 乳腺筛查中的前瞻部署数据与人工仲裁交互结果,可了解落地时的数据漂移与仲裁量问题。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出涵盖感知。
Google 与康奈尔大学合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统共 6 个 LLM 回答 67 道高温超导专家级问题,由国际专家小组按 6 项指标盲评打分。
Google 宣布在 Flood Hub 上线城市山洪预报,借助新的 AI 方法可在城市地区提前最多 24 小时预测山洪风险。为弥补山洪缺乏地面实测数据的问题,Google 用 Groundsource 方法结合 Gemini 分析公开新闻报道,构建历史山洪事件数据集来训练和评估新模型。
推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的思路与全球覆盖取舍。
Google 推出 Groundsource,一种用 Gemini 从非结构化全球新闻中提取灾害数据的可扩展方法,并开放首个城市山洪数据集,包含 260 万条记录、覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:原文给出了用 Gemini 从新闻抽取灾害数据的方法与验证结果,读者可据此判断 LLM 构建历史基准的可行边界。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。
距 AlphaGo 成为首个击败围棋世界冠军的程序已十年,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。这一突破直接催生了 AlphaFold 2,已折叠科学界已知的 2 亿个蛋白质结构并免费开放,全球超 300 万研究人员使用该数据库。AlphaGo 的搜索与强化学习方法还延伸至 AlphaProof、AlphaEvolve 及 AI co-scientist 等系统。
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言、服务超 1 亿使用者的开放语音数据集,采用 CC-BY-4.0 许可。该数据集包含约 1,846 小时 ASR 转写语音和超 565 小时 TTS 高保真录音,由非洲学术与社区机构主导采集,2021 年起历时多年完成。
Google 开源 AI 模型 SpeciesNet 可对相机陷阱图像分类近 2,500 个动物类别,训练数据达 6,500 万张标注图像。该模型配合开源模型 MegaDetector 定位动物,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可达 25 万张以上。过去一年,研究团队已用它识别哥伦比亚的美洲狮、爱达荷州的麋鹿与黑熊、澳大利亚的食火鸡以及坦桑尼亚塞伦盖蒂的狮子和大象。
Google Research 提出"贝叶斯教学"方法,通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单次交互后性能就停滞,难以随新信息持续更新;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 级速度。
推荐理由:原文列出 Nano Banana 2 在主体一致性、文字渲染和分辨率上的具体规格,可对照 Pro 版判断速度与质量的取舍。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的更强核心推理模型,在 ARC-AGI-2 上取得 77.1% 的验证分数,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 Gemini 3.1 Pro 在 ARC-AGI-2 上的验证分数与多端上线范围,可据此判断其推理能力提升幅度。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户用文本或上传图片、视频即可生成带歌词的 30 秒曲目,并配有 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式与 SynthID 音频验证能力,可了解音乐生成的产品化路径。
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
Google DeepMind 宣布与印度政府机构及本地机构建立 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist 和 Earth AI 等前沿科学模型。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。
推荐理由:官方给出 Deep Think 在数学、编程与科学基准上的具体成绩和 API 开放路径,可据此判断专业推理模式的当前水位。
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Google Research 与 Google DeepMind 发现,主要用鸟类等陆生动物音频训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型有效迁移到海洋任务,用于区分须鲸物种和虎鲸生态型。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具打造更具适应性的无障碍应用,以 agent 驱动的动态模块取代静态导航。原型包括面向盲人与低视力用户的 StreetReaderAI,以及基于 Gemini 模型、可实时语音调整描述细节的 Multimodal Agent Video Player(MAVP)。
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国性随机对照研究,读者可了解对话式 AI 进入真实虚拟诊疗的评估路径。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,可创建、探索和 remix 交互式世界。
推荐理由:原文给出 Project Genie 的三项核心能力与已知限制,读者可据此判断世界模型原型当前能做什么、还差什么。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。
推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。
Google Research 提出 ATLAS 多语言缩放定律,基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,可指导模型规模与语言配比选择。其跨语言迁移矩阵显示,支持语言数翻倍时模型规模需增至 1.18 倍、数据量增至 1.66 倍。该研究将发表于 ICLR 2026。
Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。
Google Research 提出一种基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 IMU 信号(50 Hz 三轴加速度计与陀螺仪)加用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:原文给出 MedGemma 1.5 与 MedASR 的基准提升和开放下载入口,读者可据此判断医疗多模态模型的可用边界。