跳到正文

#数据/训练

今日 0 条
6月25日周四
6月19日周五
  1. Hugging Face Blog41

    MosaicLeaks:你的研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。

6月18日周四
6月17日周三
6月8日周一
  1. Google DeepMind62

    Google DeepMind 在塞拉利昂开展 AI 学习试验,数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于八周内取得 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与交互数据,读者可据此了解AI辅助教学的实际效果与局限。

6月4日周四
  1. Google Research50

    Google 开源洪水预报水文建模框架

    Google Research 在 GitHub 开源其水文建模框架,让各国气象水文机构可将 AI 洪水预报集成进自身工作流。该框架为基于 PyTorch 的 Python 包,采用 LSTM 架构,训练流程使用开源 Caravan 数据集,并已与捷克水文气象研究所(CHMI)合作验证。新版模型相较 2024 年基准版本,在有测站流域将可靠预测期延长 6 天,无测站流域延长 1 天。

6月3日周三
  1. OpenAI News60

    OpenAI 为 GPT-Rosalind 推出新能力

    OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学专长、基因组分析与实验工作流能力。

    推荐理由:OpenAI 公布 GPT-Rosalind 在生物推理、药物化学与基因组分析上的能力扩展,读者可据此了解该模型在生命科学场景的定位。

5月29日周五
5月27日周三
  1. Hugging Face Blog66

    Hugging Face 在 TRL 中实现增量权重同步,异步 RL 每步传输量降至 20-35MB

    Hugging Face 在 TRL 中落地了增量权重同步(Delta Weight Sync):只把两次 RL 优化步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件,上传到 Hugging Face Bucket,再由 vLLM 拉取应用。

    推荐理由:TRL 的稀疏增量权重同步把异步 RL 每步传输量压到原来的百分之几,读者可据此判断跨集群训练的成本边界。

5月20日周三
  1. Google Research71

    Google 在 Nature 发表 ERA:用 Gemini 编写科学代码并开放 Computational Discovery

    Google 在 Nature 发表论文介绍 Empirical Research Assistance(ERA),这是一个用 Gemini 编写和优化科学代码的研究工具,通过树搜索在数千种方案中迭代优化代码。

    推荐理由:Google 用 Gemini 驱动的 ERA 在 Nature 发表,并给出流行病、径流、CO2 等八篇应用结果,可看科研编码自动化的边界。

5月19日周二
5月17日周日
5月16日周六
  1. Google DeepMind38

    剑桥大学教授用 Google Co-Scientist 寻找跨物种传播疾病的分子开关

    剑桥大学 Clare Bryant 教授使用 Google Co-Scientist 研究流感等病原体跨物种传播时引发败血症等重症的分子开关。Co-Scientist 生成并排序了一批假说,其中优先标记出一个她此前未关注的蛋白,并将其细化到具体氨基酸位点。Bryant 团队正构建含氨基酸突变的细胞系验证假说,原本需两到三年的实验工作有望在六个月内完成。

  2. Google DeepMind40

    Google Co-Scientist 助力发现抗肝纤维化老药新用

    Stanford 遗传学家 Gary Peltz 用 Google Co-Scientist 筛选可重定位治疗肝纤维化的现有药物,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝瘢痕形成的损伤反应。相关研究已发表于 Advanced Science。

5月12日周二
5月8日周五
  1. Berkeley AI Research31

    自适应并行推理:高效推理扩展的新范式

    伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild! Inference 的并行结构多由外部设定,而非模型自主选择。

5月6日周三
  1. Google DeepMind73

    Google DeepMind 公布 AlphaEvolve 一年进展:从 TPU 设计到商业客户落地

    Google DeepMind 回顾了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用进展,称其已从试点成为 Google 基础设施的核心组件,用于优化下一代 TPU 设计和缓存替换策略。

    推荐理由:原文汇总了 AlphaEvolve 在基因组、电网、量子物理和商业客户中的落地数据,可据此判断编码智能体的跨领域适用范围。

5月5日周二
5月2日周六
4月30日周四
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何训练的:IBM 公开数据工程、预训练与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。

4月25日周六
4月22日周三
4月21日周二
  1. Hugging Face Blog34

    QIMMA:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。

4月20日周一
  1. Berkeley AI Research33

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究提出 GRASP,一种面向学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度,使长时程规划更实用、更鲁棒。该工作由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 与 Amir Bar 合作完成。

4月16日周四
  1. Google Research38

    Google 提出 Simula:面向真实世界的合成数据集机制设计与推理框架

    Google 提出推理优先的合成数据生成框架 Simula,无需种子数据,将数据集构建拆解为全局多样化、局部多样化、复杂化和质量检查四个可控维度,并以 Gemini 2.5 Flash 为教师模型、Gemma-3 4B 为学生模型在网络安全、法律推理、GSM8k 和 Global MMLU 等五个领域生成最多 512K 数据点。

4月10日周五
4月9日周四
4月1日周三
3月25日周三