跳到正文

全部动态

今日 0 条
3月4日周三
2月20日周五
2月19日周四
2月18日周三
  1. Google Research37

    Google 用 MapTrace 合成数据教多模态大模型在地图上寻路

    Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。

2月11日周三
  1. Google Research31

    Google 开源 DialogLab:编写、模拟与测试动态人-AI 群组对话

    Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。

2月10日周二
  1. Google DeepMind74

    Google DeepMind 发布两篇论文,用 Gemini Deep Think 推进数学与科学发现

    Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式解决数学、物理与计算机科学领域的专业研究问题。

    推荐理由:DeepMind 公开了 Gemini Deep Think 在数学、物理与计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级标准。

2月4日周三
  1. Google Research35

    Google Research 提出 Sequential Attention:让 AI 模型更小更快且不牺牲精度

    Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。

1月28日周三
  1. Google Research60

    Google Research 发布智能体系统扩展研究:多智能体并非越多越好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。

    推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。

1月27日周二
1月24日周六
  1. Google Research27

    Google 推出 GIST:智能采样的下一阶段

    Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。

1月23日周五
  1. Google Research33

    Google 研究:小模型通过分解式方法实现更优用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。

1月21日周三
1月20日周二
1月16日周五
1月13日周二
1月10日周六
  1. Berkeley AI Research29

    信息驱动的成像系统设计:Berkeley AI Research 提出基于互信息的成像系统评估框架

    Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。

12月18日周四
12月16日周二
12月11日周四
  1. Google Research26

    Google 提出 Urania:为 AI 聊天机器人使用洞察提供差分隐私框架

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。

12月9日周二
12月5日周五
12月4日周四
12月3日周三
11月25日周二
11月22日周六
  1. Google Research20

    Google 如何用简单 AI 模型预测电动车充电桩可用性

    Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。

11月21日周五
11月19日周三
  1. Google Research75

    Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒

    Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。

    推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。

  2. Hugging Face Blog60

    ServiceNow 发布 Apriel-H1:将 15B 推理模型蒸馏为 Mamba 混合架构,吞吐提升 2.1 倍

    ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。

    推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。

11月14日周五
11月13日周四
  1. Google DeepMind62

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。

11月11日周二
  1. Google DeepMind42

    Google DeepMind 研究:让 AI 像人类一样“看”世界

    Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。

11月8日周六