跳到正文

#论文/研究

今日 5 条
6月25日周四
6月22日周一
6月19日周五
  1. Hugging Face Blog41

    MosaicLeaks:你的研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。

6月18日周四
6月17日周三
6月16日周二
6月11日周四
6月8日周一
  1. Google DeepMind62

    Google DeepMind 在塞拉利昂开展 AI 学习试验,数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此了解AI辅助教学的实际效果与局限。

6月5日周五
  1. Google Research67

    Google 研究用手机前置摄像头实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图相比 MAPE 低于 10%,覆盖所有肤色。

    推荐理由:Google 用 35 万段手机视频训练 rPPG 模型,并公开迄今最大规模数据集,读者可了解被动心率监测的可行边界。

6月1日周一
  1. Import AI32

    Import AI 459:AI 监管为何困难、蛋白质折叠模型的缩放定律、以及为 AI 系统灭绝风险定价

    Import AI 459 讨论了 AI 经济的爆炸式增长与 GDP 统计的脱节、用 AI 监督 AI 的自动化对齐为何比想象中更难、蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价。其中一项研究估算 2025 年美国 AI 名义 GDP 约 2500 亿美元,质量调整后实际年增速约 2600%。

5月28日周四
  1. Google Research31

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将一次性提交的新型密码学聚合协议与 TEE 结合,使设备无需多轮在线即可安全上报数据。该设计保证 Google 只能获得群体匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明则向参与者验证协议按公开代码正确执行。

5月20日周三
  1. OpenAI News76

    OpenAI 模型推翻离散几何核心猜想

    OpenAI 表示其模型解决了有 80 年历史的单位距离问题,推翻离散几何中的一个重要猜想,被视为 AI 驱动数学的一个里程碑。

    推荐理由:OpenAI 模型推翻离散几何中一个长期猜想,读者可了解 AI 在数学证明上的进展。

  2. Google Research71

    Google 在 Nature 发表 ERA:用 Gemini 编写科学代码并开放 Computational Discovery

    Google 在 Nature 发表论文介绍 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,通过树搜索在数千种方案中迭代优化代码。

    推荐理由:Google 用 Gemini 驱动的 ERA 在 Nature 发表,并给出流行病、径流、CO2 等八篇应用结果,可看科研编码自动化的边界。

5月19日周二
5月18日周一
5月16日周六
  1. Google DeepMind40

    Google Co-Scientist 助力发现抗肝纤维化老药新用

    Stanford 遗传学家 Gary Peltz 用 Google Co-Scientist 筛选可重定位治疗肝纤维化的现有药物,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝瘢痕形成的损伤反应。相关研究已发表于 Advanced Science。

5月12日周二
5月11日周一
  1. Import AI22

    Import AI 456:RSI 与经济增长、AI 监管的"激进可选性"、以及神经计算机

    Institute for Law & AI 提出"激进可选性"监管思路,主张政府短期避免过度监管,同时建设信息收集、举报人保护、评估与人才等能力,为 AI 剧变保留政策工具。Meta 与 KAIST 的论文提出 Neural Computer,尝试用神经网络在学习到的运行时状态中统一计算、内存与 I/O。

5月8日周五
  1. Berkeley AI Research31

    自适应并行推理:高效推理扩展的新范式

    伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。

4月30日周四
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何训练的:IBM 公开数据工程、预训练与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。

4月22日周三
4月20日周一
  1. Berkeley AI Research33

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。

4月16日周四
  1. Google Research38

    Google 提出 Simula:面向真实世界的合成数据集机制设计与推理框架

    Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。

4月9日周四
4月3日周五
  1. Google Research39

    Google 如何评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。

4月1日周三
3月31日周二
3月26日周四
3月25日周三
  1. Google Research33

    Google Research 的 S2Vec 如何学习城市建筑环境的通用嵌入向量

    Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。