跳到正文

#数据/训练

今日 6 条
9月4日周五
  1. Google Research36

    Google Research 跨人群基因组预测的迁移学习研究

    Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 近 20 万日本人样本做多基因风险评分迁移学习,覆盖 BMI、血压、血脂、血糖等 8 项临床性状。结果显示目标人群样本达 15k 以上时,本地训练模型反超混合欧洲数据训练;HDL、LDL 和血糖等人群特异性强的性状从欧洲数据获益更少。

  2. Google Research66

    Google Research 与 HHMI Janelia 发布雄性果蝇完整脑图谱

    Google Research 与 HHMI Janelia 等机构在 Cell 发表雄性果蝇完整中枢神经系统连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。

    推荐理由:读者可了解AI驱动的连接组学如何完成迄今神经元数量最多的脑图谱,以及它向脊椎动物扩展的路径。

9月3日周四
9月2日周三
9月1日周二
8月28日周五
  1. Hugging Face Blog36

    Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon

    Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。

  2. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自动完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程缩短到几分钟。

    推荐理由:原文给出PPE在公共卫生、粮食安全与疫情预测上的基准对比,可了解地理空间建模自动化的能力边界。

8月27日周四
  1. Google Research34

    Google Research 推出 GlucoFM:面向连续血糖监测的双流基础模型

    Google Research 发布 GlucoFM,一个自监督双流基础模型,将血糖的慢变基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 4 个队列、7 项临床任务共 14 组评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点。

8月26日周三
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。

8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel

    METR 分析发现 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身的算法进展则未见可测加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基线提升 8.1。

8月22日周六
8月21日周五
  1. Microsoft Research34

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并推进 Psi4、FHI-aims、ORCA、VASP 集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正被集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软研究院推出持续追踪各版本计算性能的 living benchmark。

8月19日周三
  1. Hugging Face Blog62

    ALTK-Evolve 研究:智能体到底需要多少记忆

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务评测八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型对比给出了智能体记忆的三种剂量模式与 token 开销数据,可据此判断自家模型该用全量还是检索式注入。

8月18日周二
  1. Hugging Face Blog34

    同一集群利用率提升 33 个百分点:Hugging Face 约束感知 GPU 调度器如何改变分配顺序

    Hugging Face 构建了约束感知的 GPU 分配器,在相同硬件和负载下对比 FIFO 调度器,七个基准场景中 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均提升 52%。核心变化不在硬件,而在于分配决策的顺序:实时推理按需求曲线逐时间步分配,批式任务按优先级跨整个调度周期排布。

8月17日周一
8月14日周五
8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。

8月12日周三
8月11日周二
8月10日周一
  1. Import AI32

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期汇总了智库 IFP 提出的 23 条"低后悔"政策建议,分属 7 个类别,用于应对 AI 研发自动化带来的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析称,竞争对手间实现协调减速取决于技术开发的透明度与对彼此可信度的判断:低信任下所有均衡都奔向灾难,高信任下两家理性企业永远竞赛的概率随理性先验比值平方衰减。

8月6日周四
  1. Google DeepMind77

    Google DeepMind 的 WeatherNext 气旋预报精度提升,并开源模型

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均多出一天(24 小时)的预报提前量,三天预报精度相当于此前模型的两天水平。

    推荐理由:Google DeepMind 在 Nature 论文中给出气旋路径与强度预报的精度提升,并同步开源模型权重,读者可据此了解 AI 天气预报的当前进展与可用入口。

8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard 框架,支持在真实 harness 中训练智能体

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨任务域复用环境、数据管线和评测流程,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 中训练智能体。

    推荐理由:Orchard 把环境层做成可复用服务,并公开训练数据与评测方法,读者可据此判断开放智能体训练的成本门槛变化。

7月31日周五
7月30日周四
7月26日周日
  1. Berkeley AI Research35

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并加以监督评分,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。

7月22日周三
7月21日周二
  1. Hugging Face Blog62

    Hugging Face 与 Pollen Robotics 发布开源机器人操作数据采集系统 Grabette

    Hugging Face 博客发布开源低成本机器人操作数据采集系统 Grabette,用手持夹爪加双摄像头记录人类演示,自动转换为 LeRobot 数据集。Grabette 手持端 BOM 成本约 490€,配套的 Gripette 电动夹爪约 120€,硬件 CAD、采集服务、处理流水线和示例训练栈全部开源,处理流程可在浏览器中通过 HF Space 完成。

    推荐理由:原文给出了手持夹爪采集机器人操作数据的完整开源方案与成本,读者可据此判断数据采集门槛的变化。

7月16日周四
  1. Hugging Face Blog22

    新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。