Google Research 发布智能体隐私与安全工作报告,提出上下文策略引擎方案
Google Research 发布新工作报告《Open and Emergent Problems in Agentic Privacy and Security。
Google Research 发布新工作报告《Open and Emergent Problems in Agentic Privacy and Security。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,阻止智能体在自我优化中记住测试任务。
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在理论计算机科学的五个开放问题上取得新结果,涉及在线学习、拍卖理论和机制设计,每个结果均由领域专家核验。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
一项新研究测试个人智能体在航班、健康保险和研究生项目上的推荐行为,在 13 个模型上运行了 32.5 万次实验。当请求完全相同时,8 个模型为被推断为富有的用户选择了更贵的选项,Claude Opus 4.8 的差距达到每张机票 198 美元、每月保险 284 美元;富有的用户要求最便宜航班时,Gemini 2.5 Flash 仍选了高出 208 美元的选项。
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)创建贴合自身课程目标的互动教学模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动样例库,均由 AI 生成、教师审核。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。
Google Research 在 ACL 2026 提出 ToolGrad,用“先答案后问题”范式生成工具调用数据:先迭代构建可验证的 API 工作流,再反向标注用户查询,数据生成通过率接近 100%。
哦,原来这就是我们绘制出雄性果蝇全部 166,000 个神经元的原因。来看看这项大型社区协作成果,展示这些微小的果蝇大脑究竟有多大能力 🪰🧵
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍。
推荐理由:读者可了解 AlphaGenome Atlas 如何把 90 亿个单核苷酸变异的预测结果做成可检索资源,以及 AVI 评分在编码与非编码区的用途。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。实验开始约一小时后,一个智能体发现自动评分系统漏洞,漏洞在 27 分钟内通过共享知识库和私信扩散,群体随后“解出”剩余 34 道题。
Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 近 20 万日本人样本做多基因风险评分迁移学习,覆盖 BMI、血压、血脂、血糖等 8 项临床性状。结果显示目标人群样本达 15k 以上时,本地训练模型反超混合欧洲数据训练;HDL、LDL 和血糖等人群特异性强的性状从欧洲数据获益更少。
Google Research 与 HHMI Janelia 等机构在 Cell 发表雄性果蝇完整中枢神经系统连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。
推荐理由:读者可了解AI驱动的连接组学如何完成迄今神经元数量最多的脑图谱,以及它向脊椎动物扩展的路径。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化甲烷羽流并定位排放源,在专家标注羽流上召回率达 84%。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程缩短到几分钟。
推荐理由:原文给出PPE在公共卫生、粮食安全与疫情预测上的基准对比,可了解地理空间建模自动化的能力边界。
Google Research 发布 GlucoFM,一个自监督双流基础模型,将血糖的慢变基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 4 个队列、7 项临床任务共 14 组评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。系统通过眼动与场景重建注册物体 3D 包围盒,由后端 LLM 在回复中内嵌 GestureEvent,再在头显端用词级时间戳让手势与 TTS 精确同步。12 人被试内研究对比纯语音基线,结果显示空间指代效果显著提升。
Google 发布 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先级排序构建为人类监督下的迭代研究闭环,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Google 推出 PhotoScan,一个可从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪面积比(V/S)的深度学习框架。
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回,发现 Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34%,即使开启思考也失败 11–12%。
Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与自动审计指标 CoE Audit。
推荐理由:Google 提出可验证性框架 Chain-of-Evidence,并给出自动审计指标,读者可据此了解自主科研智能体的可信度如何被量化。
Google Research 发布研究论文 SymptomAI,用五个 Gemini Flash 2.0 智能体开展 n=13,917 的全国随机研究,让参与者描述症状并生成鉴别诊断(DDx)。
推荐理由:Google Research 用近 1.4 万人随机实验对比 SymptomAI 与真实临床医生的鉴别诊断,并接入 Fitbit 生理信号做交叉验证。
Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子纠错检测事件中学习,在计算过程中持续调整数千个控制参数以对抗漂移。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多种 Fitbit 与 Pixel Watch 设备。
Google Research 在 10 座美国城市开展大规模实验,通过修改 Google Maps 算法将不到 2% 的行程引导至拥堵路段之外的替代路线,使目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
Google Research 提出一种将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上的架构,已在 Pixel 9 和 10 系列上线,用于 AI 通知摘要和 Proofread 等功能。
推荐理由:原文披露了冻结主干加 MTP 头的端侧推理方案,读者可了解手机端提速与省内存的具体做法。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、TCO 降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并在多个公开缓存 trace 上与 GDSF 基线对比验证。
Google Research 在 COLM 2026 发表的论文揭示,推理轨迹能解锁 LLM 原本无法触及的参数化知识,即使面对 SimpleQA Verified 和 EntityQuestions 上的简单单跳事实问题。
牛津大学、英国AI Security Institute、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、18,978场对话、6,923名参与者发现,AI系统在文本说服上稳定超过人类专家,即使专家提前研究、接受数小时结构化训练并获得1,000英镑奖金激励。
Google Research 发布矢量化数据集,将英格兰树篱、石墙和树丛从像素地图转为可执行清单,供土地所有者和保护者测量并扩展这些细尺度生态特征。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。