跳到正文

#数据/训练

今日 7 条
2月10日周二
2月6日周五
2月5日周四
2月4日周三
  1. Google Research35

    Google Research 提出 Sequential Attention:让 AI 模型更小更快且不牺牲精度

    Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。

2月3日周二
1月29日周四
1月28日周三
  1. Google Research60

    Google Research 发布智能体系统扩展研究:多智能体并非越多越好

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族。

    推荐理由:通过 180 种智能体配置的对照实验,给出多智能体架构在并行与串行任务上的量化差异,可据此调整编排策略。

1月27日周二
1月24日周六
  1. Google Research27

    Google 推出 GIST:智能采样的下一阶段

    Google 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 是首个为该权衡提供可证明保证的算法,保证所选子集价值至少为最优解的一半,并在图像分类等基准任务上超越现有方法。

1月21日周三
1月20日周二
1月16日周五
1月14日周三
1月13日周二
1月10日周六
  1. Berkeley AI Research29

    信息驱动的成像系统设计:Berkeley AI Research 提出基于互信息的成像系统评估框架

    Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。

1月5日周一
12月18日周四
12月17日周三
12月11日周四
  1. OpenAI News70

    OpenAI 发布 GPT-5.2,在数学与科学基准上刷新成绩

    OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:原文给出 GPT-5.2 在 GPQA Diamond 与 FrontierMath 上的新结果,读者可据此了解其在数学与科研任务上的能力边界。

  2. Google Research26

    Google 提出 Urania:为 AI 聊天机器人使用洞察提供差分隐私框架

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。

12月10日周三
12月9日周二
12月8日周一
12月5日周五
12月4日周四
12月3日周三
  1. OpenAI News62

    OpenAI 宣布收购 Neptune

    OpenAI 宣布收购 Neptune,以更深入地观察模型行为,并强化研究人员用于追踪实验和监控训练的工具。

    推荐理由:OpenAI 收购 Neptune 的官方说明,交代了它在模型行为追踪与训练监控上的用途。

12月1日周一
11月26日周三
11月25日周二
11月24日周一
  1. Google DeepMind62

    Google DeepMind 支持美国能源部 Genesis 计划,向 17 个国家实验室开放 AI 科研模型

    Google DeepMind 宣布支持白宫 Genesis Mission,并与美国能源部合作,向 DOE 全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。

    推荐理由:Google DeepMind 与 DOE 的合作给出了 AI for Science 从模型到国家实验室落地的具体路径,可观察前沿模型在科研场景的接入方式。

11月22日周六
  1. Google Research20

    Google 如何用简单 AI 模型预测电动车充电桩可用性

    Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。

11月21日周五
  1. Hugging Face Blog51

    Hugging Face TRL 集成 RapidFire AI,微调实验提速最高 20 倍

    Hugging Face TRL 正式集成 RapidFire AI,用户可并发运行多个微调与后训练配置并近乎实时比较结果。RapidFire AI 通过自适应分块调度在单张 GPU 上同时跑多个配置,官方基准显示达到同等最佳训练 loss 的时间相比顺序比较提速 15 至 20 倍,并支持 SFT、DPO、GRPO 的 drop-in 配置与 MLflow 仪表盘上的停止、克隆、修改等操作。

11月19日周三
  1. Hugging Face Blog60

    ServiceNow 发布 Apriel-H1:将 15B 推理模型蒸馏为 Mamba 混合架构,吞吐提升 2.1 倍

    ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。

    推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。

11月17日周一