跳到正文

全部动态

今日 13 条
6月25日周四
6月24日周三
6月22日周一
6月19日周五
  1. Hugging Face Blog41

    MosaicLeaks:你的研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。

6月17日周三
6月16日周二
6月11日周四
6月8日周一
  1. Google DeepMind62

    Google DeepMind 在塞拉利昂开展 AI 学习试验,数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此了解AI辅助教学的实际效果与局限。

6月5日周五
  1. Google Research67

    Google 研究用手机前置摄像头实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图相比 MAPE 低于 10%,覆盖所有肤色。

    推荐理由:Google 用 35 万段手机视频训练 rPPG 模型,并公开迄今最大规模数据集,读者可了解被动心率监测的可行边界。

6月1日周一
  1. Import AI32

    Import AI 459:AI 监管为何困难、蛋白质折叠模型的缩放定律、以及为 AI 系统灭绝风险定价

    Import AI 459 讨论了 AI 经济的爆炸式增长与 GDP 统计的脱节、用 AI 监督 AI 的自动化对齐为何比想象中更难、蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价。其中一项研究估算 2025 年美国 AI 名义 GDP 约 2500 亿美元,质量调整后实际年增速约 2600%。

5月28日周四
  1. Google Research31

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将一次性提交的新型密码学聚合协议与 TEE 结合,使设备无需多轮在线即可安全上报数据。该设计保证 Google 只能获得群体匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明则向参与者验证协议按公开代码正确执行。

5月19日周二
5月18日周一
5月16日周六
  1. Google DeepMind40

    Google Co-Scientist 助力发现抗肝纤维化老药新用

    Stanford 遗传学家 Gary Peltz 用 Google Co-Scientist 筛选可重定位治疗肝纤维化的现有药物,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝瘢痕形成的损伤反应。相关研究已发表于 Advanced Science。

5月12日周二
5月8日周五
  1. Berkeley AI Research31

    自适应并行推理:高效推理扩展的新范式

    伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。

5月6日周三
4月30日周四
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何训练的:IBM 公开数据工程、预训练与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。

4月22日周三
4月21日周二
  1. Hugging Face Blog34

    QIMMA:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。

4月20日周一
  1. Berkeley AI Research33

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。

4月16日周四
  1. Google Research38

    Google 提出 Simula:面向真实世界的合成数据集机制设计与推理框架

    Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。

4月9日周四
4月3日周五
  1. Google Research39

    Google 如何评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。

4月1日周三
3月31日周二
3月26日周四
3月25日周三
  1. Google Research33

    Google Research 的 S2Vec 如何学习城市建筑环境的通用嵌入向量

    Google Research 推出自监督框架 S2Vec,将建筑环境栅格化为多层特征图像,用掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可刻画任意地点的特征。在 US-wide 人口密度、收入中位数等社会经济指标的零样本地理外推任务上,S2Vec 通常是表现最好的单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态。在树木覆盖、海拔等环境任务上仍有明显改进空间。

3月18日周三
3月17日周二