跳到正文

#论文/研究

今日 0 条
12月16日周二
12月11日周四
  1. Google Research26

    Google 提出 Urania:为 AI 聊天机器人使用洞察提供差分隐私框架

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。

12月5日周五
12月4日周四
12月3日周三
11月25日周二
11月22日周六
  1. Google Research20

    Google 如何用简单 AI 模型预测电动车充电桩可用性

    Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。

11月21日周五
11月20日周四
11月19日周三
  1. Google Research75

    Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒

    Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。

    推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。

  2. Hugging Face Blog60

    ServiceNow 发布 Apriel-H1:将 15B 推理模型蒸馏为 Mamba 混合架构,吞吐提升 2.1 倍

    ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。

    推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。

11月14日周五
11月13日周四
  1. Google DeepMind62

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。

11月11日周二
  1. Google DeepMind42

    Google DeepMind 研究:让 AI 像人类一样“看”世界

    Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。

11月8日周六
11月7日周五
11月6日周四
11月5日周三
  1. Google Research60

    Google 发布 Project Suncatcher 预印本,探索太空 AI 基础设施设计

    Google 公布研究项目 Project Suncatcher,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。

    推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的实测数据,可了解这一设想的技术边界。

11月1日周六
10月30日周四
10月17日周五
10月14日周二
10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入评测新基准

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。

9月26日周五
9月23日周二
9月22日周一
9月17日周三
  1. OpenAI News62

    OpenAI 与 Apollo Research 开发检测和减少 AI 模型 scheming 的评测

    Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还分享了具体案例,以及对一种早期减少 scheming 方法的压力测试。

    推荐理由:OpenAI 与 Apollo Research 公开了针对模型隐藏失配的评测与缓解方法,读者可了解该风险如何被检测。

9月15日周一
  1. OpenAI News38

    OpenAI 研究揭示人们如何使用 ChatGPT

    OpenAI 基于迄今规模最大的 ChatGPT 使用研究,展示了该工具如何在个人与职业场景中创造经济价值。研究显示,ChatGPT 的用户群体正从早期用户向更广泛人群扩展,逐步缩小使用差距,让 AI 融入日常生活。

9月10日周三
9月5日周五
9月3日周三
9月1日周一
  1. Berkeley AI Research32

    word2vec 究竟学到了什么:伯克利提出可闭式求解的学习理论

    伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。该理论给出特征向量的显式公式,仅由语料共现统计和超参数决定;从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。

8月27日周三
8月5日周二