跳到正文

#数据/训练

今日 7 条
11月14日周五
11月13日周四
11月12日周三
  1. Google Research39

    Google 发布 JAX-Privacy 1.0:面向大规模机器学习的差分隐私工具库

    Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于大规模机器学习差分隐私训练的模块化工具库。新版本集成最新 DP 算法研究成果,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等方法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行,可在多加速器和超算上训练大模型。

11月11日周二
  1. Google DeepMind42

    Google DeepMind 研究:让 AI 像人类一样“看”世界

    Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。

11月8日周六
11月7日周五
11月6日周四
11月5日周三
  1. Google Research60

    Google 发布 Project Suncatcher 预印本,探索太空 AI 基础设施设计

    Google 公布研究项目 Project Suncatcher,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。

    推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的实测数据,可了解这一设想的技术边界。

10月31日周五
10月30日周四
10月29日周三
  1. Hugging Face Blog62

    Hugging Face 分析全球算力格局变迁:中国国产芯片与开源模型的双向推动

    Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。

    推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。

10月27日周一
10月22日周三
10月17日周五
10月14日周二
10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入评测新基准

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。

9月29日周一
9月26日周五
9月25日周四
9月22日周一
  1. Hugging Face Blog33

    Hugging Face 推出 SyGra:为 LLM 与 SLM 构建数据的一站式框架

    Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端。该框架覆盖从 SFT 到 DPO 的偏好对生成、知识库转 Q&A、推理增强、质量过滤及跨语言转换等场景,以 Python 库形式集成到现有 ML 工作流。

9月16日周二
9月11日周四
9月10日周三
9月9日周二
9月3日周三
9月1日周一
  1. Berkeley AI Research32

    word2vec 究竟学到了什么:伯克利提出可闭式求解的学习理论

    伯克利 AI 研究团队提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。该理论给出特征向量的显式公式,仅由语料共现统计和超参数决定;从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。

8月22日周五
8月21日周四
8月1日周五
7月23日周三
6月18日周三
6月11日周三
10月1日周二
8月21日周三
8月14日周三
8月12日周一
  1. Hugging Face Blog62

    TII 发布 Falcon Mamba 7B:首个强性能无注意力 7B 模型

    阿布扎比技术创新研究院(TII)发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。

    推荐理由:原文给出 Falcon Mamba 的架构取舍、训练数据与两组基准对比,可据此判断无注意力架构在长序列上的位置。

8月8日周四
  1. Hugging Face Blog62

    Hugging Face 收购 XetHub,将用其技术替换 Hub 的 Git LFS 存储后端

    Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入并帮助 Hub 从 Git LFS 切换到自研的存储与版本管理后端。XetHub 的分块存储与去重技术可让 10GB Parquet 文件只重传新增行所在的少量分块,GGUF 模型文件改一个元数据值也只需重传几 KB。

    推荐理由:Hugging Face 收购 XetHub 并计划替换 Git LFS 存储后端,读者可了解 Hub 大文件版本管理将如何变化。