跳到正文

#Google

今日 0 条
3月31日周二
3月29日周日
  1. Google DeepMind62

    Google DeepMind 为 AI 时代重新设计鼠标指针,Gemini 驱动的 AI 指针已进入 Chrome

    Google DeepMind 公布了一套 AI 指针的交互原则,让指针不仅知道指向什么,还能理解它对用户的意义,由 Gemini 驱动。团队提出四条原则:保持工作流不被打断、用指向加语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转化为可操作实体。

    推荐理由:Google DeepMind 公开了 AI 指针的四条交互原则,并说明该能力已进入 Chrome 与 Googlebook,读者可据此判断浏览器内 AI 交互的走向。

3月26日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。

3月25日周三
  1. Google Research33

    Google Research 的 S2Vec 如何学习城市建筑环境的通用嵌入向量

    Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。

3月18日周三
3月17日周二
3月12日周四
  1. Google Research67

    Google 在 Flood Hub 上线城市山洪预报,提前 24 小时预警

    Google 宣布在 Flood Hub 上线城市山洪预报,借助新的 AI 方法可在城市地区提前最多 24 小时预测山洪风险。为弥补山洪缺乏地面实测数据的问题,Google 用 Groundsource 方法结合 Gemini 分析公开新闻报道,构建历史山洪事件数据集来训练和评估新模型。

    推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的思路与全球覆盖取舍。

  2. Google Research60

    Google 推出 Groundsource,用 Gemini 将新闻报道转为灾害数据

    Google 推出 Groundsource,一种用 Gemini 从非结构化全球新闻中提取灾害数据的可扩展方法,并开放首个城市山洪数据集,包含 260 万条记录、覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:原文给出了用 Gemini 从新闻抽取灾害数据的方法与验证结果,读者可据此判断 LLM 构建历史基准的可行边界。

  3. Google Research66

    Google 与 BIDMC 开展真实临床研究,评估对话式诊断 AI AMIE 的可行性

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。

    推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。

3月9日周一
  1. Google DeepMind35

    AlphaGo 十周年:从围棋到生物学,DeepMind 回顾其对 AI 与科学的深远影响

    距 AlphaGo 成为首个击败围棋世界冠军的程序已十年,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。这一突破直接催生了 AlphaFold 2,已折叠科学界已知的 2 亿个蛋白质结构并免费开放,全球超 300 万研究人员使用该数据库。AlphaGo 的搜索与强化学习方法还延伸至 AlphaProof、AlphaEvolve 及 AI co-scientist 等系统。

3月7日周六
  1. Google Research32

    Google SpeciesNet:用 AI 识别野生动物

    Google 开源 AI 模型 SpeciesNet 可对相机陷阱图像分类近 2,500 个动物类别,训练数据达 6,500 万张标注图像。该模型配合开源模型 MegaDetector 定位动物,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可达 25 万张以上。过去一年,研究团队已用它识别哥伦比亚的美洲狮、爱达荷州的麋鹿与黑熊、澳大利亚的食火鸡以及坦桑尼亚塞伦盖蒂的狮子和大象。

3月5日周四
  1. Google Research37

    Google 如何教 LLM 像贝叶斯那样推理

    Google Research 提出"贝叶斯教学"方法,通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单次交互后性能就停滞,难以随新信息持续更新;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。

3月4日周三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。

2月27日周五
2月20日周五
2月19日周四
  1. Google DeepMind69

    Gemini 应用上线 Lyria 3 音乐生成,支持文本和图片生成 30 秒曲目

    Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户用文本或上传图片、视频即可生成带歌词的 30 秒曲目,并配有 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式与 SynthID 音频验证能力,可了解音乐生成的产品化路径。

2月18日周三
  1. Google Research37

    Google 用 MapTrace 合成数据教多模态大模型在地图上寻路

    Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。

2月17日周二
2月13日周五
2月11日周三
  1. Google Research31

    Google 开源 DialogLab:编写、模拟与测试动态人-AI 群组对话

    Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。

2月10日周二
  1. Google DeepMind74

    Google DeepMind 发布两篇论文,用 Gemini Deep Think 推进数学与科学发现

    Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。

    推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。

2月5日周四
2月4日周三
  1. Google Research35

    Google Research 提出 Sequential Attention:让 AI 模型更小更快且不牺牲精度

    Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。

1月30日周五
  1. Google DeepMind66

    Google DeepMind 向美国 AI Ultra 订阅用户开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,可创建、探索和 remix 交互式世界。

    推荐理由:原文给出 Project Genie 的三项核心能力与已知限制,读者可据此判断世界模型原型当前能做什么、还差什么。

1月28日周三
  1. Google Research60

    Google Research 发布智能体系统扩展研究:多智能体并非越多越好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。

    推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。

1月24日周六
  1. Google Research27

    Google 推出 GIST:智能采样的下一阶段

    Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。

1月23日周五
  1. Google Research33

    Google 研究:小模型通过分解式方法实现更优用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。

1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。

    推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。

1月14日周三